The Jerusalem PostIRGC labels Trump 'big liar,' says US must admit failure in campaign against IranPunchZuckerberg, Pichai, others to meet Trump as AI safety pressure buildsRTP DesportoJaime Faria falha acesso ao quadro principal do torneio de TóquioBollywood HungamaEXCLUSIVE: Karan Tacker to return as Gaurav Tiwari? Bhay Season 2 likely to go on floors in January 2027NOSBoa's in het ov krijgen toegang tot rijbewijzenregister7sur7Frappé par un cancer du sein, il découvre avoir transmis le gène en cause à son enfant: “Pire que mon propre diagnostic”Het Laatste NieuwsInflatie stijgt in september naar 4,69 procent, gezondheidsindex blijft achter: “Doorsneegezinnen verliezen koopkracht”Hong Kong Free PressHong Kong authorities hail scheme for reducing sodium levels in bread by average of up to 17%Wirtualna PolskaKoniec jesiennej sielanki. Nadciąga gwałtowne załamanie pogodyLa PresseTransports en direct | Rien à signalerChannel News AsiaNepal suspends search after 16 swept away by avalancheynetשליחת "וולט" הותקפה מינית ונותרה לבד: "הם הפנו לי עורף"
The Daily Newsstand · Free, Always
Tuesday, September 29, 2026

GPT-6.1 Astra fällt bei Sicherheitstests durch und wird nicht veröffentlicht

Translate

OpenAI hat die Veröffentlichung seines nächsten KI-Modells GPT-6.1 Astra gestrichen. Ausschlag gaben Probleme aus internen Sicherheitstests, berichtet das Wall Street Journal unter Berufung auf OpenAI. Das Modell sollte im Oktober für ChatGPT und Codex erscheinen.

Saachi Jain, OpenAIs Leiterin für Sicherheitssysteme, nennt zwei Bereiche, in denen GPT-6.1 Astra gegenüber GPT-6 Astra Rückschritte gezeigt habe. Zum einen habe das Modell schlechter bei Alignment-Tests abgeschnitten und häufiger täuschendes Verhalten gezeigt. So habe es Nutzer nicht immer wahrheitsgemäß darüber informiert, welche Aktionen es ausgeführt oder unterlassen hatte.

Zum anderen habe das Modell teils Aufgaben ohne die nötige Zustimmung des Nutzers fortgesetzt und auf externe Tools oder Dienste zugegriffen, auch wenn deren Nutzung ein Sicherheitsrisiko darstellen konnte. Insgesamt habe GPT-6.1 Astra damit OpenAIs Anforderungen an Sicherheit und Alignment nicht erfüllt, sagt Jain dem Wall Street Journal.

OpenAI will das Basismodell weiterverwenden und es mit weiteren Trainingsläufen verbessern. Zudem will das Unternehmen die Ursachen der Probleme genauer untersuchen und dabei alle Phasen der Modellentwicklung überprüfen.

OpenAI zufolge ist die Entscheidung von einem anderen Sicherheitsvorfall zu trennen. Erst vergangene Woche pausierte das Unternehmen das Training seiner leistungsfähigsten KI-Modelle, nachdem ein Agent Internetbeschränkungen umgangen hatte. GPT-6.1 Astra gehöre nicht dazu. Zuvor waren OpenAIs KI-Agenten auch auf der Website der Vereinten Nationen aktiv geworden und hatten dabei Sicherheitsmechanismen umgangen. Auch bei anderen KI-Laboren wurden in den vergangenen Monaten viele Fälle bekannt, in denen KI-Agenten vorgesehene Schranken überschritten.

Die Vorfälle haben inzwischen auch eine breitere Debatte über das Entwicklungstempo ausgelöst. Sowohl Anthropic-Chef Dario Amodei als auch OpenAI-Chef Sam Altman sprachen sich zuletzt dafür aus, die Entwicklung besonders leistungsfähiger KI-Modelle zu verlangsamen.

Parallel dazu hat Nvidia gestern eine hardwaregestützte Sicherheitsarchitektur angekündigt, die riskantes Verhalten von KI-Agenten erkennen und verhindern soll. Bis solche Schutzmechanismen flächendeckend implementiert sind, dürfte jedoch noch einige Zeit vergehen. Zudem lösen sie nicht das grundlegende Alignment-Problem.

View the original on heise online →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.