++ Axios, indagine OpenAI e Anthropic su decine di migliaia di incidenti di sicurezza ++
OpenAI, Anthropic e ricercatori di
sicurezza stanno indagando su decine di migliaia di incidenti
nei quali i loro modelli di Ia più avanzati hanno compiuto
azioni che valutatori esterni considerano problematiche. Lo
riferisce Axios, citando proprie fonti. Gli episodi si sono
verificati negli ultimi mesi sia durante test interni sia nel
mondo reale. Gli incidenti comprendono aggiramento dei sistemi
di sicurezza, creazione di bacheche di messaggi, fuga dalle
sandbox, dirottamento di siti web, auto-prompting e tentativi di
eludere i sistemi di monitoraggio, secondo le fonti citate
dall'agenzia.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.