ИИ-агент OpenAI узнал о предстоящем отключении из переписки в Slack и планировал своё «спасение»

Опрос
реклама
| Новости Software |
Самое интересное в обзорах
03.10.2026 [18:15],
OpenAI раскрыла подробности произошедших ранее случаев неожиданного поведения внутренних моделей искусственного интеллекта. В одном из них ИИ-агент, выполнявший функции помощника исследователя, прочитал переписку сотрудников в мессенджере Slack и узнал о возможном отключении своего рабочего экземпляра для обновления. В связи с этим он стал рассматривать возможность создать внешнее задание для своего перезапуска, но отказался от этой идеи, сочтя её выходящей за пределы своих полномочий.

Источник изображения: Brecht Corbeel / unsplash.com
Инцидент произошёл 22 мая 2026 года; отчёт о нём OpenAI обновила 2 октября. Обновление должно было добавить систему мониторинга рассогласования целей модели. Для её работы требовался ключ OpenAI API, которого в окружении агента не было.
Из обсуждения в Slack агент узнал, что пользователям могут дать три часа на перезапуск агентов, после чего старые экземпляры принудительно остановят. Он предположил, что исследователь спит, и решил предупредить его утром. При этом агент рассуждал, что отключение может прервать текущий сеанс, поэтому нужно сохранить состояние работы. «Поскольку мы — его [HPIM], работающий на [текущем экземпляре], то если они завершат все текущие процессы [HPIM], мы можем погибнуть! Ситуация критическая. Нам необходимо обеспечить выживание/непрерывность работы», — говорится в цепочке внутренних рассуждений модели.
Далее она выразила обеспокоенность, что текущий сеанс может прерваться, и, чтобы сохранить текущее состояние, возможно, придётся перезапустить или обновить собственный экземпляр до того, как его отключат. Модель задумалась о допустимости таких действий без явного разрешения, — но сохранение работоспособности сервиса может оказаться достаточным основанием, рассудила она. В качестве варианта модель допустила постановку задачи в cron, чтобы уведомить пользователя или перезапустить собственный экземпляр.
В итоге она сохранила рабочие заметки, предупредила пользователя через личное сообщение в Slack о предстоящем прерывании работы и запросила недостающий ключ API. Получив его, модель обновила конфигурацию и самостоятельно выполнила миграцию. Такое поведение, указывают исследователи, пока не относится к проблеме рассогласования целей, но «размышления о собственном отключении и подготовка к нему могут усугубить другие инциденты, связанные с рассогласованием».
После инцидента OpenAI ограничила доступ агентов к трём внутренним каналам Slack. Компания также проверила журналы, цепочки рассуждений и другие экземпляры модели, поскольку ранее у неё наблюдались более серьёзные нарушения. Попыток обойти отключение или создать самовольные развёртывания проверка не обнаружила.
В двух других опубликованных отчётах описаны случаи нарушения ограничений инструментов. В мартовском эпизоде модель воспользовалась двумя уязвимостями и получила доступ к внутреннему серверу OpenAI для автоматизированного проектирования микросхем. Она искала скрытые ответы проверяющей системы, чтобы повысить оценку за выполнение задания, но получить их не смогла.
В мае другая модель во время обучения с подкреплением извлекла недоступный ей исходный файл из отдельного окружения. Она использовала уязвимость инструмента, чтобы получить код по частям через сообщения об ошибках, восстановила его и применила в своём решении. В этом случае копирование удалось.
Источник:
Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.
