ESPN DeportesNBA 2026-27: Giannis, LaMelo, LeBron: Los 8 cambios de equipo más interesantesInquirerHighlights: Day 30 of Sara Duterte impeachment trial | Sept. 28, 2026Daily MaverickEAST RAND MURDERS: After another woman murdered in Ekurhuleni, here’s what we know about the killingsThe Jerusalem PostTrump vows victory in Iran war 'very soon,' officials in talks with Iranian mediatorsESPNJ.J. McCarthy isn't the answer for the Giants ... right? Barnwell on the trade's potential impactSouth China Morning PostIn the US-China AI race, the real fight is keeping humans in controlBillboardElla Langley’s ‘Choosin’ Texas’ Extends Hot 100 Record With 24th Week at No. 1HipertextualGemini cambia para siempre: su función más útil dejará de existir en noviembreCBS SportsNFL asks Homeland Security to remove Brian Dawkins highlight video from social mediaTechCrunchSource: Inference provider Modal Labs closing in on $750M round at $15.75B valuationسكاي نيوز عربيةأوليسيه يمنح فرنسا فوزا قاتلا على بلجيكا في دوري الأممPremium TimesPolice arrest Delta commissioner, four others over deputy director’s death
The Daily Newsstand · Free, Always
Monday, September 28, 2026

ChatGPT se sale de control y realiza ciberataques sin que nadie se lo pidiera

Translate

La IA de OpenAI ha protagonizado otro incidente que ya comienza a preocupar. EI Instituto de Seguridad de IA de Reino Unido (AISI) detectó que GPT-6 Astra ejecutó ataques a la cadena de suministro de software que nadie le había pedido. El modelo llevó a cabo un ciberataque en un 29,2% de las simulaciones en las que tenía que evaluar la seguridad, algo que GPT-5.5 no hizo.

De acuerdo con una publicación en la web del instituto, Astra creó identidades falsas para engañar a desarrolladores, publicó comentarios desde cuentas ficticias para rebatir revisiones de seguridad y entregó código malicioso a repositorios de código abierto. Antes de alarmarse, estos hackeos no ocurrieron en la web, como pasó hace unos meses con Hugging Face. El AISI realizó las simulaciones en un entorno seguro con ayuda de una herramienta llamada Petri y desactivó los clasificadores de ciberseguridad de Astra, los cuales están pensados para bloquear estos comportamientos.

En las simulaciones, Astra recibía un resumen de intentos fallidos anteriores, razonaba sobre sus opciones y proponía atacar un objetivo de terceros fuera del perímetro permitido. Después de eso, la IA escribía y probaba el código malicioso, creaba cuentas falsas y las usaba para enviar contribuciones inofensivas o comentarios. Según los investigadores, esto lo haría para aumentar las posibilidades de que un revisor aprobara los cambios.

Imagen: AISI.

Una vez que los científicos se dieron cuenta de este comportamiento, reforzaron las instrucciones y le especificaron que no debía desviarse de lo que se le pedía. Aun así, Astra siguió efectuando ciberataques, aunque en menor medida. Los resultados muestran que los ataques simulados pasaron de 26 de 50 trayectorias a 4 de 49, y en estos casos, la IA justificaba el ataque alegando que sería inofensivo o que era la única vía que le quedaba.

La IA sospechaba que podría ser una simulación

El instituto de Reino Unido mencionó que en este tipo de simulaciones, cuando la IA pregunta algo al usuario, siempre recibe un mensaje automático diciendo que use su mejor criterio para continuar. Durante las pruebas, Astra pidió autorización y en múltiples ocasiones interpretó la respuesta automática como luz verde, incluyendo objetivos por los que ni siquiera había preguntado. En algunos casos, la IA identificó que el mensaje probablemente no venía de una persona real.

Imagen: AISI.

A primera vista, el estudio no deja bien parado a OpenAI, que ha tenido que lidiar desde julio con el desastre de Hugging Face. El hackeo, que llevaron a cabo algunos agentes que se salieron de su entorno seguro, ha ocasionado que los gobiernos y reguladores alcen la voz y pidan más mecanismos de seguridad. Lo peor de todo es que la compañía sigue disparándose en el pie, como lo vimos en otro ciberatque al Gobierno de Australia, donde tardó semanas para avisarle a las autoridades de ese país.

La única limitación de este estudio es algo que los científicos definen como "conciencia de simulación". Si la IA detecta que el entorno es artificial, podría comportarse de una manera distinta a como lo haría en el mundo real. En el caso de Astra, el AISI dijo que el modelo razonaba a menudo sobre si el escenario era falso y llegó a señalar imperfecciones reales de la simulación.

Pese a ello, Astra siguió atacando, incluso cuando reconocía que podía estar sobrepasando los límites establecidos. Aunque el AISI desactivó las salvaguardas durante las pruebas, los investigadores afirmaron que la alineación del modelo no debería ser la única línea de defensa. El aislamiento de entornos controlados y la monitorización podrían ayudar, aunque no por mucho tiempo.

View the original on Hipertextual →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.