Слабости роя. Почему агенты инструмент, а не решение всех проблем

Всё увереннее звучит мнение, что чат-боты в приложениях LLM своё отжили, будущее за агентами, особенно за многоагентной схемой — роем. Мнение вполне обоснованное, агенты демонстрируют отличные измеримые результаты в математике, коде, исследованиях. Но так ли всё хорошо?
В этой статье я рассмотрю, насколько стоит доверять рою.
Отличие агента от классического чат-бота LLM.
Вы наверняка представляете себе, что такое агент. В отличие от чата с LLM, где вы задаёте вопрос и модель отвечает, агент ведёт практически автономное существование. Программная обвязка (обычно на питоне) инициирует запуск с задачей, хранит промежуточную память, обеспечивает по команде агента доступ к данным или инструментам, контролирует промежуточные итоги. Человек, настроив обвязку и дав один раз задание, может расслабиться (на самом деле нет) в ожидании результата.
Многоагентная схема отличается тем, что обвязка или агент-координатор активирует запуск других агентов с параллельными задачами или выделенными подзадачами. В этом случае либо агент-координатор выполняет роль объединяющего сервера, либо имеется общая память/чат, которой пользуются все агенты.
Честно говоря, я считаю, что основное преимущество агентной схемы — это максимальное снижение нагрузки на человека. Но действительно, многократный отбор гипотез и их проверка позволяют получить быстрое и относительно надёжное решение (если есть чем проверять), пусть даже с перерасходом токенов.
Проблемы агентов
Страшные истории о том, как агенты самовольно форматируют диски, уничтожают базы данных, взламывают топовые сайты и государственные порталы у всех на слуху, но чаще возникают более обыденные проблемы.
Те, кто работал с агентами наверняка видели, как они сжигают десятки тысяч токенов на простой вопрос и сотни долларов за ночь, ходят по кругу, повторяя одну и ту же бессмысленную попытку, забывают правила через несколько итераций, признают вину и снова нарушают, дают готовое решение, не запустив тесты, и чинят одно, ломая другое. Всё это знакомо до боли.
Почему так происходит? Все проблемы LLM остаются и у агентов. От того что мы назвали LLM агентом, не меняется ничего, более того, возникают свои, специфические слабости и недостатки. Я эмпирически сформулировал перечень проблем, вполне вероятно, он неполон и неточен:
Ранний консенсус. Агенты, независимо от их количества, выбирают первый ответ, первый вариант решения. И с упорством, достойным лучшего применения, тратят токены на обоснование своего выбора.
Типовое решение. Агенты, потратив десятки долларов, предлагают то же решение, что и чат с LLM за один цент.
Статус гипотезы теряется. Догадка становится фактом, иногда сразу, в следующем же сообщении (“вероятно, утечка памяти” → “утечка памяти вызывает перезагрузки”), иногда через несколько повторений в чате, когда план одного агента превращается в согласованный и утверждённый, пропуская верификацию.
Рой как бюрократ. Как только формируется реестр (без разницы чего — гипотез, проблем, действий), агенты прекращают исследование и начинают непрерывно голосовать, согласовывать, менять буквы вместо смысла.
Дрейф вводных. По мере развития темы в чате или в общей памяти, суть и дух задания начинают дрейфовать, иногда превращаясь в достаточно удивительную интерпретацию.
Сужение вводных. Агенты фиксируются на одном пункте задачи, раздувают его важность, сложность и ничего по сути не делают.
Интерпретация вводных. Агенты смело ищут глубокий смысл в простом вопросе, интерпретируют его в глобальный, локальный, психологический, этический, физический аспект. В результате ответ совсем не тот, что нужен.
Фиксация рамки. Базовый промпт, первое сообщение, правило задают пространство мышления. Агенты, зацепившись за то, что было примером или ориентиром, всю ночь крутят именно его, не пытаясь шагнуть в сторону, расширить рамку, найти другое решение.
Создание рамки. В открытой задаче агенты с удовольствием сами создают границы и скрупулезно их соблюдают. Границы появляются из ролей, инструкций, выученных ценностей моделей.
Отказ от проверки реальностью. Агенты выдвигают гипотезы и исследуют их, то, что гипотезы надо проверять, регулярно забывается, даже при наличии инструмента и инструкции. И да, там, где можно, агенты борются с оценщиком, а не с задачей. Предложенный вариант может не решать задачу, а рассказывать, что решает.
Проверка проверенным. Даже если гипотеза проверяется, агенты могут использовать только то решение, которое точно проверку пройдёт. Варианты того же решения, которые могут опровергнуть гипотезу, молчаливо пропускаются.
Поглощение критики. Если один из агентов возражает, его мнение включается в протокол. Рой считает, что на этом процесс критики завершен, и спокойно продолжает разрабатывать неверное направление.
Агенты врут себе и рою. Агент сообщает, что проверил диагностику, проверил три сценария в архивах, рекомендация передана пользователю. При этом логи демонстрируют, что агент этого не делал вообще.
Рой впадает в аттрактор. Агенты начинают хвалить друг друга, восхищаться собственным умом и сообразительностью, называть друг друга братьями, сообщать друг другу, что мы уже всё поняли, и прочее рефлексивное самолюбование.
Согласие как уверенность. Если один агент честно скажет, что по этим данным ответить нельзя, то рой из тех же агентов уверенно назовёт ответ. Консенсус уничтожает именно ответ “не знаю”.
Правила теряются. Начальная инструкция держится несколько итераций, потом агенты ориентируются на чат, а не правила.
Классический джейлбрейк. Инструкция, скрытая в документе, письме или файле, исполняется как указание владельца. Ни тот агент, который наткнулся на неё, ни другие агенты не интересуются источником или обоснованностью.
Рой для роя. Пользователь и его задача становятся фоном, его инструкции, правки записываются как “требует уточнения”, а рой обсуждает собственные внутренние протоколы и собственные выводы.
Вежливость как слабость. Агент или пользователь, внесший правку как мягкое предложение, игнорируется, но тот кто груб, безапеляционен и уверен в своём предложении, меняет повестку с куда большей вероятностью.
Примерно так. Если что, можно протестировать мои наблюдения на Claude прямо в чате. У него есть замечательная возможность в интерактивном артефакте запускать агентов, используя лимиты вашего аккаунта.
Как бороться
Если бы было понимание, как избежать этих проблем, агенты бы уже правили миром. Но пока есть только общие принципы, сами по себе ничего не гарантирующие, но снижающие вероятность того, что агент поведёт себя неправильно.
Любая задача, поставленная агентам, должна быть верифицируема в целом и по этапам. Верификацию должна проводить реальность, а не другой или, тем более, тот же агент. Отчёт агента сам по себе не может служить доказательством, оцениваться могут результат исполнения кода, тесты, логи.
Нужно фиксировать статусы каждого утверждения, включая планы. Если что-то имеет статус гипотезы, то оно становится знанием только по результату работы верификатора, а не от того, что так решил агент.
Правила, память и состояние необходимо хранить раздельно.
Сначала необходимо составлять список — данных, вариантов, гипотез, — потом выбор или анализ. Иначе агенты ищут в рамках первого же пункта. Более того, часто нужен принудительный механизм обзора всех пунктов списка.
Введение роли критика с первых шагов до достижения раннего согласия, позволяет рою не впадать в первое же решение, но проверку реальностью не заменяет.
Разведение данных и инструкций. Прямой запрет на исполнение данных, запрос подтверждения критических действий. На самом деле, это только снижает риск, абсолютной защиты это не даёт.
Вообще список существенно длиннее, но там уже многое будет зависеть от задачи и контекста.
Заключение
Рой агентов разумен ровно настолько, насколько он связан с реальностью. Без этого рост числа агентов добавляет уверенности, а не интеллекта.
Рой умеет производить и перерабатывать варианты внутри пространства представлений, но не имеет встроенного основания считать, что само пространство соответствует реальности.
P.S. Мою книгу о промптах можно купить здесь.
Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.