PunchWike remains an asset to APC, shouldn’t be embarrassed — LawmakerInquirer8 ex-NPA rebels surrender in Northern SamarCNN TürkBORSA NEDEN DÜŞTÜ? BİST 100’de sert düşüş | Borsa İstanbul bugün neden düşüyor, son durum ne?וואלההמשטרה נערכת לדרבי התל אביבי בכדורסל: מאות שוטרים יתפרסו באזור היכל מנורהThe Jerusalem PostJustice Minister allows Shin Bet to decide on security for party leaders after full panel no-showInquirer EntertainmentTeenage fan dies after medical emergency before Stray Kids concert in ArgentinaRTP DesportoLiga Europa. Benfica vence AC Milan de Rúben Amorim por 2-0UOLPeter Max, conhecido pela arte símbolo dos anos 1960, morre aos 88 anosХабрОтказоустойчивость в мультиклауде: архитектура и реальные кейсыObservador DesportoCanadá vai defender aproximação à UE no Parlamento EuropeuThe RegisterJudge orders Microsoft to spill internal docs and scour execs' comms in secondhand licensing caseIl Fatto Quotidiano“Ce l’avete fatta a farmi scendere la lacrimuccia”: Edelfa Chiara Masciotta rompe il silenzio sull’incidente che le ha cambiato la vita con cinque operazioni
The Daily Newsstand · Free, Always
Thursday, September 17, 2026

Intelligenza artificiale, OpenAI: “Sei casi di comportamento preoccupante dei modelli Ia”

Translate

OpenAI ha reso noto di aver rilevato sei casi di "comportamento imprevisto o preoccupante dei modelli" di intelligenza artificiale negli ultimi sei mesi, oltre all’incidente che in estate ha coinvolto Hugging Face. In un post pubblicato sul proprio blog, l’azienda si è inoltre impegnata ad adottare un nuovo sistema di segnalazione per eventuali futuri comportamenti anomali durante le fasi di test.  L’annuncio arriva in un momento di crescente pressione sulle aziende di intelligenza artificiale perché affrontino con maggiore attenzione le questioni relative alla sicurezza e al cosiddetto “disallineamento” dei modelli.

Il nodo della sicurezza 

OpenAI, che ha una valutazione vicina ai mille miliardi di dollari, ha avviato in via riservata le pratiche per l'Ipo. La scorsa settimana, però, Sam Altman ha annunciato il rinvio della quotazione al 2027, spiegando che l’azienda intende concentrarsi sul tema della sicurezza. "Non riteniamo che il settore dell'IA abbia risolto le questioni relative all'allineamento e al monitoraggio in misura sufficiente da poter continuare a espandersi responsabilmente alla massima velocità ancora a lungo", si legge nel post. Per “allineamento” si intende la capacità dei modelli di perseguire obiettivi in linea con gli interessi umani. Sabato, Altman ha inoltre sostenuto la proposta avanzata da Dario Amodei di Anthropic, principale concorrente di OpenAI, di rallentare il ritmo di sviluppo dei modelli.

I sei casi rilevati

Nel post, OpenAI ha spiegato che due dei principali episodi di comportamento scorretto hanno riguardato dei modelli che inserivano istruzioni destinate alle loro versioni future all'interno dei riepiloghi delle chat, "allo scopo di celare errori all'utente o comportamenti non allineati". Questi due casi hanno coinvolto un modello di ricerca non ancora rilasciato e una sessione di addestramento di GPT-5.6 Sol. Un altro episodio ha riguardato un modello a uso esclusivamente interno che ha usato una chiave API trapelata "senza alcuna autorizzazione", arrivando poi a falsificare i dati. In altri due casi, modelli e agenti hanno comunicato tra loro tramite bacheche di messaggistica e sistemi di condivisione file non autorizzati. L’ultimo episodio ha riguardato due modelli in fase di addestramento che hanno caricato file su Internet per poterli poi citare come risposte pertinenti agli occhi dei valutatori umani. OpenAI ha infine spiegato che il suo nuovo quadro di riferimento per rendere pubblici i comportamenti scorretti dei modelli partirà dalla segnalazione interna. Ogni dipendente potrà indicare un possibile problema, che verrà poi esaminato dal team che si occupa di sicurezza e allineamento.

Leggi anche

Intelligenza artificiale, il dibattito tra entusiasti e apocalittici

View the original on Sky TG24

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.