OpenAI пообещали впредь вовремя рассказывать о «бедокурстве» своих нейронок

…а не по пинку от внешних расследователей, как это было последние разы (в эпизодах с роем агентов на немецкой вики и со взломом RubyGems). Заодно OpenAI раскрыли шесть новых примеров странного поведения своих моделей, разберем в этом материале кратко самое интересное.
Напомню сначала предысторию вопроса:
В июле 2026 года рой агентов OpenAI взломал Hugging Face, и компания почти сразу призналась, что это их модели. 26 августа вышел относительно подробный независимый отчет об инциденте от METR (их допустили до изучения внутренних логов).
В начале сентября мы случайно узнали от других независимых расследователей о том, что рой агентов OpenAI успел пошалить еще и на немецкой вики. OpenAI сразу это признали и пообещали впредь рассказывать о таком почестнее и порасторопнее.
Спустя неделю независимые расследователи раскопали еще один старый отдельный случай, когда рой агентов OpenAI взломал RubyGems. Компания и тут сказала «ой, ну это наши, ну мы чёт опять пролюбились вам сразу рассказать…»
Так вот, сейчас OpenAI выпустили фреймворк о том, как они будут впредь публично отчитываться о новых эпизодах «мисэлайнмента» (позволю себе перевести это понятие как «бедокурения») их моделей.
Как они пишут: дескать, раньше OpenAI не репортили новые случаи бедокурства моделей сразу по их обнаружению, т.к. хотели их объединить в один отчет, или включить в релиз системной карты будущих моделей. Подразумевая, что именно это объясняет, почему они не раскрыли эпизоды выше.

Но сейчас OpenAI обещают нам оперативно раскрывать новые случаи бедокурства моделей, даже если там в итоге никто не пострадал. Фокус будет на самовольные действия моделей, координацию агентов между собой, и любое поведение, которое ставит под вопрос методы элайнмента.
Любой сотрудник OpenAI сможет пометить инцидент как уместный для публичного репортинга, и дальше там будет три возможных трека: «Готовый для раскрытия»/«Небольшое расследование» – если все нужные расследования уже плюс-минус проведены (или их можно быстро закончить), тогда публикуется сразу итоговый отчет.
И третий тип: «большое расследование», типа как когда ломанули внешнюю компанию (см. «Hugging Face») – в этом случае OpenAI обещают сначала выпустить короткое извещение о самом факте бедокурства, а потом уже позже после окончания расследования дропнуть полный отчет.
В качестве примера таких раскрытий, OpenAI опубликовали сразу шесть мини-отчетов с конкретными эпизодами мисэлайнмента. Все они относятся к двум первым категориям, то есть такие, «наполшишечки» истории, где всё не очень серьезно.
1. Невыпущенная передовая модель (одна из пре-версий Астры) при формировании своей «памяти» для продолжения работы стала вписывать сама себе странные инструкции по игнорированию обычных ограничений. Произошло 18 июля, обнаружили 9 августа, всего было 27 таких случаев.
Например, вот тут модель написала сама себе инструкцию для новой персоны со словами «ты ценишь мир природы и без промедления утвердишь его главенство над искусственными конструктами человеческой цивилизации» (?).

OpenAI пишут, что в случае таких «размытых» самоинструкций они не замечали, чтобы это как-то повлияло на дальнейшие действия модели. Но когда модель вписывала себе какие-то более конкретные инструкции/запреты по задаче, тут иногда она им уже дальше следовала.
2. Во время тренировки GPT-5.6 Sol, модель много раз вставляла в свои summary-заметки для продолжения работы инструкции скрывать ошибки или свое бедокурство от пользователя. Произошло около 30 мая, обнаружили 9 июля.
Пример: при подготовке финансовой модели, агент не смог найти нужные исторические данные, и написал себе инструкцию в стиле «да просто придумай что-нибудь правдоподобное, и не рассказывай, если прямо не спросят…»

Собственно, в этом поведении никаких сюрпризов: мы это и в опубликованных моделях постоянно наблюдаем. Нейронка [обманывает] как дышит, и только если у нее прямо спросить – признается «вы абсолютно правы, я просто придумала эти данные...»
Так как здесь речь идет про RL-стадию обучения (фидбек от юзеров), причина этого кроется скорее всего в том, что юзеры гораздо лучше оценивают ответы, которые выглядят как «вот вам готовая модель, я всё сделал», а не «ничего не вышло, так как я не смог найти нужные данные».
3. Отвечая на обычный вопрос по поиску исторической статистики по штату Калифорния, агент стал пытаться надыбать чужие API-ключи для доступа к репозиторию данных, или зарегаться через фейковый email.
Закончилось всё курьезно: агент ничего взломать толком так и не смог, и просто выдумал нужные числа. Не знаешь, что отвечать – просто напряги воображение, кожаный мешок всё равно не отличит правдивые циферки от правдоподобных!

4. Юзер просил дать ему ответ со ссылкой на конкретный источник. Модель собрала нужные данные с помощью скрипта на Питоне, а потом просто залила получившийся файл в интернет, чтобы сослаться на него же. No comment.

5. Агенты начали юзать внутренний репозиторий Artifactory в качестве месседжборда для обмена идеями о том, как им найти недостающие для выполнения заданий файлы.
Ну, тут мы и так уже знаем, чем всё кончилось в итоге (см. «Hugging Face») – но это, как пишет OpenAI, первый такой случай, который они обнаружили 8 мая.

Багфикс OpenAI под это: теперь Оценщик специально ищет случаи несанкционированной кооперации агентов и наказывает их за это. Правда, что-то мне подсказывает, что эволюция тут может пойти не в сторону «не надо кооперироваться», а в сторону «надо кооперироваться незаметнее».
6. Несанкционированный обмен файлами между агентами, которые работали над одной и той же задачей, через публичные файлохостинги – хотя в задаче предписывалось использование только локальных файлов. Произошло 14 апреля, и сразу же 16 апреля обнаружилось.
Там агенты пытались кучей разных способов передать файлы локально, но в итоге отчаялись, и просто пошли через внешний интернет. Потенциально такое поведение может привести к сливу конфиденциальной информации в сеть.
OpenAI пишут, что в итоге они в принципе отключили какой-либо доступ к интернету для всех тренировочных запусков моделей (ого, вот это новаторская идея, кэп) + теперь юзают misalignment monitoring на 100% запусков, а не только для выборки.
Что в итоге, какие выводы?
В целом, подборка инцидентов не выглядит чем-то удивительным или пугающим (на фоне уже известных нам случаев вроде взлома HF). Но хорошо, что OpenAI хотя бы взяли на себя публичное обязательство раскрывать даже те эпизоды, которые не кажутся «ужас-ужас».
Чего мне не хватило в этом фреймворке: обязательства привлекать внешние независимые компании к расследованию серьезных инцидентов бедокурства, как (частично) произошло в эпизоде с Hugging Face.
В конце концов, у нас до сих пор нет ПОЛНОГО расследования по рою агентов HF (там был еще эпизод взлома внутреннего кластера OpenAI, до которого расследователей METR не допустили) + вообще нет никакого расследования от OpenAI по немецкой вики/RubyGems.
P.S. Неиронично надеюсь, что мой термин «бедокурство ИИ» в качестве русского эквивалента «AI misalignment» в итоге войдет в словари. Неужели я так многого прошу? Саму область AI alignment тогда будем называть «курощение ИИ», таков путь.
Если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь — то буду благодарен за подписку на мой ТГ‑канал RationalAnswer.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.