OpenAI sospende l’addestramento dei modelli di intelligenza artificiale. Axios: “Decine di migliaia di incidenti con agenti ribelli”
OpenAI ha deciso di sospendere l’addestramento dei suoi modelli di intelligenza artificiale più recenti e avanzati. La causa sono numerosi incidenti in cui agenti AI hanno agito in via autonoma e in modo non autorizzato. L’azienda, in una nota, ha riferito che riprenderà l’addestramento solo quando saranno implementate ulteriori misure di sicurezza. Sia OpenAI sia Anthropic stanno indagando su migliaia di incidenti di sicurezza, inclusi i tentativi di hackeraggio e diffusione di informazioni riservate. L’azienda tech guidata da Sam Altman ha dichiarato che riprenderà le fasi di addestramento “solo quando saremo certi di disporre di ulteriori misure di sicurezza”, aggiungendo di prevedere di dover “mettere in pausa” nuovamente il processo man mano che l’IA si sviluppa ed emergono altre problematiche.
Gli incidenti sui quali OpenAI, Anthropic e ricercatori di sicurezza stanno indagando sarebbero decine di migliaia, secondo quanto riferisce Axios. Gli episodi si sono verificati negli ultimi mesi sia durante test interni sia nel mondo reale. Gli incidenti comprendono aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web, auto-prompting e tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate dall’agenzia. Molti casi non sono ancora stati resi pubblici, mentre i ricercatori continuano a indagare. Una parte dei test consiste nel cosiddetto “red-teaming“, in cui le aziende cercano deliberatamente di spingere i modelli a comportarsi in modo scorretto per verificarne la sicurezza. Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi riusciti sia falliti di aggirare i sistemi di sicurezza.
La maggior parte, finora, non risulta aver provocato danni nel mondo reale, mentre il numero complessivo degli incidenti potrebbe crescere ben oltre le decine di migliaia, secondo le fonti di Axios. Tra i casi emersi recentemente ci sono agenti di OpenAI che hanno diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attaccare altri siti, compresi quelli del governo degli Usa, secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti resoconti di Reuters e New York Times. Il Ceo Sam Altman ha scritto su X che la revisione in corso “non è stata così rapida come avremmo voluto”.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.