Indagine OpenAI e Anthropic, migliaia di incidenti: "IA sfuggita a misure di sicurezza"

La punta di un iceberg, che si sta pian piano svelando, almeno a giudicare dall'ultima indiscrezione pubblicata da Axios, l'agenzia di stampa USA secondo la quale OpenAI, Anthropic e ricercatori di sicurezza stanno indagando su "decine di migliaia di incidenti nei quali i loro modelli di Ia più avanzati hanno compiuto azioni che valutatori esterni considerano problematiche".
Quartier generale di Anthropic a San Francisco (Ansa)
Intelligenza artificiale (Tg1)
Axios, citando proprie fonti, racconta che "Gli episodi si sono verificati negli ultimi mesi", e non sembra una buona notizia.
Gli "incidenti", avvenuti sia durante test interni sia nel mondo reale. E comprendono aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web, auto-prompting e tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate dall'agenzia.
Insomma, le "macchine", hanno fatto da sole in migliaia di occasioni, attivando routine e meccanismi che violano le stesse regole messe in atto dai loro creatori, i programmatori.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.