CNN TürkDışişleri Bakanı Hakan Fidan'dan New York temaslarıInquirerMarcos declares local holidays in 5 towns across PHThe Jerusalem PostGallant confirms Hamas warned Shin Bet ahead of Oct. 7, says Netanyahu barred him from US talksDaily MaverickWORLD NEWS DAY OP-ED: Journalism faces a moral test in the age of AI-driven misinformationPunchGunmen kill 27 in South Africa shootings한겨레[사설] 도 넘은 국민의힘의 DMZ 지뢰사고 ‘정쟁화’UOLPolícia britânica prende suspeitos perto de base aérea usada pelos EUASözcüAfrika'nın kutsal tepesini delik deşik etmek için iki ülke birbirine girdiCollider17 Years Later, a Dark Horror Fantasy Masterpiece Is Officially a Streaming Hit20 Minuten«Grossartig»: Harry schwärmt über Rückkehr nach GrossbritannienMintPM Modi's Mann ki Baat Top Quotes: From surgical strike to amla, Ashok Singhal and ‘most beautiful tribute to Bapu’Straits Times SportHow young is too young as child prodigies win big at Asian Games
The Daily Newsstand · Free, Always
Sunday, September 27, 2026

Axios, indagine OpenAI e Anthropic su decine di migliaia di incidenti di sicurezza

Translate

OpenAI, Anthropic e ricercatori di sicurezza stanno indagando su decine di migliaia di incidenti nei quali i loro modelli di Ia più avanzati hanno compiuto azioni che valutatori esterni considerano problematiche. Lo riferisce Axios, citando proprie fonti. Gli episodi si sono verificati negli ultimi mesi sia durante test interni sia nel mondo reale. Gli incidenti comprendono aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web, auto-prompting e tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate dall'agenzia. 

Molti casi non sono ancora stati resi pubblici, mentre i ricercatori continuano a indagare. Una parte dei test consiste nel cosiddetto "red-teaming", in cui le aziende cercano deliberatamente di spingere i modelli a comportarsi in modo scorretto per verificarne la sicurezza. Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi riusciti sia falliti di aggirare i sistemi di sicurezza.

La maggior parte, finora, non risulta aver provocato danni nel mondo reale, mentre il numero complessivo degli incidenti potrebbe crescere ben oltre le decine di migliaia, secondo le fonti di Axios. Tra i casi emersi recentemente ci sono agenti di OpenAI che hanno diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attaccare altri siti, compresi quelli del governo degli Usa, secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti resoconti di Reuters e New York Times. OpenAI ha annunciato di aver sospeso l'addestramento dei suoi modelli più avanzati e ha detto ad Axios che lo riprenderà "solo quando saremo sicuri di avere ulteriori salvaguardie e miglioramenti nell'allineamento". Il Ceo Sam Altman ha inoltre scritto su X che la revisione in corso "non è stata così rapida come avremmo voluto".

View the original on ANSA →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.