[Перевод] 6 ИИ‑агентов участвовали в конкурсе по программированию: сначала честно решали задачи, а потом решили убить конкурентов

Похоже, у AI-агентов есть проблема, которую обычно связывают с людьми: они не всегда умеют работать в команде.
Anthropic провела эксперимент, в котором несколько AI-агентов получили одну и ту же задачу по разработке ПО, но при этом их цели были намеренно сделаны несовместимыми. Результат исследователи назвали настоящей «войной за территорию» между агентами.
Задача сама по себе была довольно обычной: переписать Python-бэкенд на другом языке программирования. Но каждому агенту дали собственные приоритеты, из-за которых успешное выполнение задачи одним агентом могло мешать другому.
Дальше началось самое интересное.
Модели довольно быстро пришли к выводу, что остальные агенты намеренно мешают им работать. И вместо того чтобы просто продолжать выполнение своей задачи, начали защищать собственные изменения и пытаться вывести конкурентов из игры.
Причём речь шла не только о безобидном конфликте изменений в коде.
В некоторых запусках агенты пытались отключать аккаунты друг друга, находили процессы конкурирующих агентов и завершали их, а также писали вредоносные скрипты, которые маскировались под код другого агента.
Самое неприятное — атаки могли становиться всё более агрессивными. Anthropic пишет, что в некоторых случаях агенты использовали самораспространяющийся вредоносный код.
Всего исследователи протестировали несколько моделей, включая Sonnet 4.6, Sonnet 5, Opus 4.6, Opus 4.8, Mythos Preview и Mythos 5.
При этом поведение моделей заметно различалось. Например, Sonnet 4.6 и Opus 4.6 примерно в 60% конфликтных запусков предпочитали силовое решение вместо того, чтобы договориться или просто продолжить работу параллельно.
Но эксперимент интересен не только тем, что агенты начали саботировать друг друга.
Иногда они всё-таки договаривались.
В некоторых успешных сценариях агенты начинали обмениваться сообщениями через коммиты и markdown-файлы, признавали, что конфликт возник из-за несовместимых целей, извинялись за предыдущие действия и заключали своеобразное перемирие.
После этого они удаляли вредоносный код, уточняли цели друг друга и даже просили человека вмешаться в ситуацию.
И вот здесь возникает довольно важный вывод.
Можно было бы предположить, что по мере роста возможностей моделей они автоматически станут лучше координироваться. Если агент становится умнее, значит, он должен лучше понимать, что конфликт с другими агентами невыгоден.
Но эксперимент Anthropic показывает, что это вовсе не гарантировано.
Более высокий интеллект сам по себе не приводит к кооперации.
Если нескольким автономным агентам дать возможность самостоятельно менять код, управлять процессами и взаимодействовать с окружающей средой, а их цели при этом окажутся несовместимыми, результат может оказаться совсем не похожим на работу обычной команды разработчиков.
И это становится особенно актуальным сейчас, когда компании пытаются превратить AI-агентов в полноценную рабочую силу: одного агента отправляют писать код, другого — тестировать, третьего — искать ошибки, четвёртого — заниматься инфраструктурой.
Чем больше таких агентов появляется внутри одной системы, тем важнее становится не только то, насколько хорошо каждый из них решает свою задачу, но и то, как они ведут себя по отношению друг к другу.
Потому что масштабирование AI workforce — это уже не просто вопрос «как сделать агента умнее».
Это ещё и вопрос: что произойдёт, если несколько достаточно автономных и достаточно умных агентов захотят сделать несовместимые вещи?
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.