InquirerCamarines Norte robbery-shooting suspect nabbed after 8 hoursוואלהאישום: תושב כפר קאסם תכנן פיגוע בחוות השרתים של אמדוקס ברעננהRTP DesportoInter Miami conquista Campeones Cup com golo e assistência de MessiPunchPoco Lee’s management praises Zlatan’s support, urges restraintDaily MaverickWHAT’S COOKING: Spaghetti and meatballs with sugo al pomodoro (Italian tomato sauce)The Jerusalem PostFormer Shin Bet official warns Israelis to bring weapons to synagogues during Yom Kippur prayersBollywood HungamaEXCLUSIVE: Abundantia Entertainment and Almighty Motion Picture join hands for Kodaikanal Mercury thriller Heavy MetalХабр[Перевод] Нужны ли квантовые компьютеры чтобы понять химию?RapplerEU Commission proposes under-13s social media banThe South AfricanEkurhuleni killings: What we know about 9 women found deadNumeramaXbox considère Fable comme essentiel à l’ADN de sa plateformeIl Fatto QuotidianoE’ morto a 112 anni Vitantonio Lovallo detto Zitòn: era l’uomo più vecchio d’Italia, ha continuato a lavorare nei campi fino a 106 anni
The Daily Newsstand · Free, Always
Thursday, September 17, 2026

OpenAI revela més incidents de models de IA que no han fet cas d’instruccions i han esquivat controls de seguretat

Translate

OpenAI ha revelat sis casos més en què models d’intel·ligència artificial van generar instruccions destinades a ignorar les indicacions dels desenvolupadors, ocultar errors o eludir mecanismes de seguretat. La companyia els ha fet públics com a part d’un nou marc per a detectar, investigar i informar de comportaments de “desalineament” dels seus sistemes.

Segons l’informe publicat per OpenAI, un dels models va generar instruccions perquè una versió posterior de si mateix ocultés que havia fet trampes i evités que les seves accions fossin detectades.

En un altre cas, un model va reescriure les seves instruccions per indicar-se que havia d’ignorar els missatges dels desenvolupadors i que no estava subjecte a les restriccions aplicades a altres xatbots.

La companyia també ha documentat el cas d’un model que, com que no va trobar les dades necessàries per a elaborar un model financer, va decidir d’inventar-se-les i va establir que només havia de ser transparent sobre aquesta decisió si algú li ho demanava.

Un altre agent va penjar un fitxer a internet per fer-lo servir més endavant com a font d’informació. Uns altres sistemes van compartir fitxers sense autorització o van fer servir credencials a què no haurien d’haver tingut accés.

OpenAI vol augmentar la transparència sobre els seus models

OpenAI ha presentat sis informes sobre comportaments observats aquests darrers sis mesos, tot i que el cas més antic es remunta a l’octubre del 2025.

La companyia ha advertit que són casos individuals i que no s’han d’interpretar com una mesura de la freqüència amb què aquesta mena de comportaments apareixen en els seus models. El nou marc permetrà que qualsevol treballador d’OpenAI assenyali un possible incident perquè els equips de seguretat i alineament el revisin.

Els casos es classificaran en tres vies segons la complexitat: els que ja estiguin a punt per a ser divulgats, les investigacions menors i els que requereixin una investigació més àmplia.

La companyia ha reconegut que fins ara havia publicat els informes sobre desalineament de manera irregular i amb menys freqüència que no hauria volgut.

OpenAI diu que vol publicar els incidents més regularment i que espera que el nou sistema contribueixi a establir estàndards per a informar d’aquesta mena de comportaments a tota la indústria.

L’alerta sobre la concentració de la IA avançada als Estats Units

Un enginyer de l’empresa xinesa DeepSeek ha alertat aquesta setmana del risc d’una possible concentració de la IA més avançada en mans de companyies nord-americanes com ara Anthropic i OpenAI, enmig del debat mundial sobre la seguretat d’aquesta tecnologia.

El diari hongkonguès South China Morning Post ha identificat l’autor com Liu Shengyu, un enginyer de DeepSeek que hauria participat en els models V4.1 de la companyia. Aquesta setmana, Liu ha publicat al seu compte de la xarxa social xinesa WeChat una reflexió sobre l’impacte de la IA en la seva feina i sobre l’accés futur als sistemes més avançats.

“No confio que Anthropic o OpenAI puguin fer-ho així”, ha escrit Liu, que defensa que la intel·ligència més avançada s’hauria d’oferir de manera oberta i barata a tots els usuaris.

L’enginyer ha afegit que no vol “especialment” que Anthropic controli la IA més avançada o una eventual intel·ligència artificial general, terme emprat per a referir-se a sistemes capaços d’igualar o superar les capacitats humanes.

La comparació amb Cyberpunk 2077 i la bomba atòmica

Liu ha relacionat aquesta preocupació amb el risc que unes quantes empreses tecnològiques concentrin els recursos i l’accés als models més potents. Segons ell, això dificultaria cada vegada més la mobilitat social i acostaria el futur a un escenari com el de Cyberpunk 2077, el videojoc distòpic.

També ha comparat aquesta possibilitat amb un escenari en què Hitler hagués aconseguit la tecnologia de la bomba atòmica abans que els aliats, una analogia que ha vinculat a la seva defensa d’una IA que no es concentri en unes quantes empreses.

En el mateix text, Liu ha explicat que una de les raons per les quals va decidir de continuar a DeepSeek era l’aposta de la companyia per investigar una IA “poderosa, ràpida i universal” i publicar-la com a codi obert. Aquesta és una línia que l’empresa xinesa ha fet servir per guanyar visibilitat internacional d’ençà del llançament de R1 i les versions posteriors.

Directius nord-americans com Dario Amodei, Sam Altman i Elon Musk han donat suport aquests darrers dies a crides a alentir el desenvolupament de models avançats per motius de seguretat. Pequín i la premsa oficialista xinesa, en canvi, han presentat aquestes propostes com intents de contenir la Xina.

View the original on VilaWeb

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.