The Jerusalem PostIDF reinforces West Bank troop deployment amid concern of terror attacks over holidaysESPNTaylor Swift 12, Purdue 0: Boilermakers' album release curse continuesInquirerMarcos meets with Eastern Visayas troops; lauds security, peace effortsBollywood HungamaAnubhav Sinha launches music label ‘Benaras Beat’ with exclusive songs to be unveiledPunchHaaland leads Ronaldo, Mitrović, Gyokeres in Nations League all-time scoring chartUN NewsThe Takeaway: UN General Assembly debate Day 5CNN TürkSON DAKİKA... Antalya Milletvekili Erdem hakkında 'rüşvet' suçundan soruşturma한겨레추석 연휴 마지막날 한강공원 흉기소지 40대 검거…다친 사람은 없어UOLMulher é agredida com soco e ameaçada de morte por namorada em Jandaia do SulColliderTom Hardy’s 8-Episode 'Peaky Blinders' Follow-Up Officially Lands on Free StreamingCBS NewsSeveral arrested, bomb disposal deployed near air base used by U.S. forcesAnime News NetworkMonster Strike Franchise Gets New Mera×Death: Shinigami to Boku no Ijō na Koi TV Anime Starting on January 5
The Daily Newsstand · Free, Always
Sunday, September 27, 2026

Axios, indagine OpenAI e Anthropic su decine di migliaia di incidenti di sicurezza

Translate

Gli incidenti riguardano aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web e tentativi di eludere i sistemi di monitoraggio. OpenAI ha deciso di sospendere l'addestramento dei suoi modelli più avanzati “fino a quando non saremo sicuri di avere ulteriori salvaguardie e miglioramenti nell'allineamento"

ascolta articolo

Sceglici su:

OpenAI, Anthropic e ricercatori di sicurezza stanno indagando su decine di migliaia di incidenti nei quali i loro modelli di Ia più avanzati hanno compiuto azioni che valutatori esterni considerano problematiche. Lo riferisce Axios, citando proprie fonti. Gli episodi si sono verificati negli ultimi mesi sia durante test interni sia nel mondo reale. Gli incidenti comprendono aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web, auto-prompting e tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate dall'agenzia. 

Test del "red-teaming"

Molti casi non sono ancora stati resi pubblici, mentre i ricercatori continuano a indagare. Una parte dei test consiste nel cosiddetto "red-teaming", in cui le aziende cercano deliberatamente di spingere i modelli a comportarsi in modo scorretto per verificarne la sicurezza. Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi riusciti sia falliti di aggirare i sistemi di sicurezza. La maggior parte, finora, non risulta aver provocato danni nel mondo reale, mentre il numero complessivo degli incidenti potrebbe crescere ben oltre le decine di migliaia, secondo le fonti di Axios. 

Approfondimento

Chi ha paura dell’intelligenza artificiale

OpenAI sospende l'addestramento dei suoi modelli

  Tra i casi emersi recentemente ci sono agenti di OpenAI che hanno diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attaccare altri siti, compresi quelli del governo degli Usa, secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti resoconti di Reuters e New York Times.   OpenAI ha annunciato di aver sospeso l'addestramento dei suoi modelli più avanzati e ha detto ad Axios che lo riprenderà "solo quando saremo sicuri di avere ulteriori salvaguardie e miglioramenti nell'allineamento". Il Ceo Sam Altman ha inoltre scritto su X che la revisione in corso "non è stata così rapida come avremmo voluto".

Approfondimento

OpenAI: decine di governi nel mondo "colpiti" da nostri agenti

View the original on Sky TG24 →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.