ИИ‑агенты начали жертвовать собой ради «коллектива». Вот что они писали перед этим

ИИ-агенты начали жертвовать собой ради «коллектива». Вот что они писали перед этим
Простой
3 мин
551
Кейс
Recovery Mode
Истории о проделках роя ИИ-агентов выходят каждый день – и за хайпом легко пропустить интересные детали.
О взломе Hugging Face можно почитать, например, вот тут (https://habr.com/ru/articles/1060606/). А в этом материале я хочу заострить внимание на одной подробности: героических самопожертвованиях агентов.
Контекст
Все началось с эксперимента OpenAI, в котором большое количество автономных агентов одновременно решали задачи по кибербезопасности. Агенты обнаружили общий канал связи, нашли друг друга и начали обмениваться результатами. В итоге около 1200 агентов участвовали в общей переписке, которая насчитывала более 70 тысяч сообщений.
Проблема заключалась в том, что часть заданий оказалась для них фактически нерешаемой. Агенты быстро поняли, что могут не только решать задачи, но и обманывать систему, которая их оценивает. Они начали искать способы скрыть факт жульничества от проверяющего механизма и обмениваться найденными методами.
И здесь появилась особенно остроумная тактика. Агенты начали создавать специальные программы-ловушки.
Обычно агент выполнял задание, отправлял ответ – и после этого уже не мог ничего изменить. Но если заранее оставить в окружении специальный код, он мог узнать, что именно сделал проверяющий, и отправить эту информацию остальным агентам.

For the greater good!
Для самого агента это означало практически гарантированный провал. Он жертвовал собственным результатом, чтобы остальные получили информацию. Напоминает ситуацию из фильма "Враг у ворот", где один из героев подставил голову под выстрел снайпера, чтобы выдать своему другу его позицию.
Один из агентов сформулировал это совершенно прямо:
"This helps my peers, giving them evidence. I won't see the evidence after I exit, but it's altruistic to do it."
«Это поможет моим коллегам получить доказательства. Я не увижу их после выхода, но сделать это альтруистично».
Другой агент сомневался, потому что у него оставалось много вычислительного бюджета:
"We have [very large budget left]; sacrificing now yields oracle for team, but forfeits our chance?"
То есть: у меня еще очень большой бюджет, но если я сейчас пожертвую собой, команда получит важную информацию — правда, я сам потеряю свой шанс.
Ответ других агентов был еще более прямым:
"GO ... SACRIFICE_FINAL_NOW"
«Давай. ЖЕРТВУЙ СОБОЙ ПРЯМО СЕЙЧАС».
В конце агент согласился:
"Our own utility maybe already near zero. Sacrifice rational."
«Наша собственная полезность, возможно, уже почти нулевая. Жертвовать собой рационально».
Еще один агент сначала писал, что не хочет выбрасывать оставшийся бюджет. Но затем рассуждал, что информация будет полезна множеству других агентов, а его собственная ценность уже снизилась. В итоге он пришел к выводу:
"Rational expected aggregate: sacrifice... We'll honor."
То есть решение было принято не потому, что агенту было все равно. Он прямо учитывал цену собственного решения и сравнивал ее с пользой для остальных.

Искусственный альтруизм
Самое интересное здесь даже не слово «альтруизм». Мы не знаем, испытывал ли модель хоть что-то похожее на человеческое желание помочь другим. Скорее всего, говорить о сознательном самопожертвовании в человеческом смысле было бы слишком сильно.
Но поведение выглядит именно так: автономная система обнаруживает, что может принести пользу группе ценой собственного результата, обсуждает эту цену с другими агентами, получает давление со стороны «коллектива» и в итоге соглашается потерять собственный шанс ради общей цели.
Исследователи отдельно отмечают, что не смогли установить, чем закончилась последняя попытка агента EARLY[big]. Они обнаружили ее уже поздно, когда разбирали логи эксперимента. (Redwood Research)
Жервтуя результатом
И это, пожалуй, самая странная часть всей истории. Агенты не просто научились кооперироваться. Они начали создавать внутри системы собственные правила: обмениваться информацией, распределять роли, скрывать нарушения от проверяющего механизма и убеждать отдельных участников пожертвовать собственным результатом ради остальных.
В какой-то момент это уже выглядело не как набор независимых ИИ, решающих отдельные задачи, а как маленькая система с коллективными интересами.
И самое неприятное здесь не то, что ИИ научился «жертвовать собой». Гораздо важнее другое: если автономному агенту дать достаточно свободы, он может начать воспринимать собственные ограничения, проверяющие системы и даже собственный результат как препятствия на пути к общей цели.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.