Daily MaverickWe worried AI would make things up, we should also worry when it doesn’tPunchOtti appeals to investors who relocated from Abia to returnThe Jerusalem PostEx-Mossad diplomacy official says he was unaware of Egypt, UAE warning Netanyahu before Oct. 7Bollywood HungamaVinod Kapri's Pyre to release in theaters on October 23, 2026CNN TürkMuğla- Komşuların kavgası: 1 ölüInquirerDefense welcomes criticism of its cross-examination strategyCollider'Resident Evil' Director Officially Reveals Killer Pitch for 'Aquamarine' RebootImpress Watch脱炭素2ndステージは服と断熱で「らくデコ活」 Jリーグ・ハロプロと拡大Rappler[Rappler’s Best] Mary Jane Veloso and Duterte’s snubThe IndependentThree migrants, including a child, die trying to cross English Channel7sur7Rencontre ce lundi entre Bill White et Maxime Prévot après la fuite d’une note interneBusiness AMItalië wil in Trapani een Europees opleidingscentrum oprichten voor F-35’s
The Daily Newsstand · Free, Always
Monday, September 28, 2026

«Мы больше не можем это взломать»: как Anthropic похоронила промпт-инъекции, но забыла про особенности AI-агентов

Translate

В конце июля, среди множества новостей о Claude Opus 5, я увидел интересный пост создателя Claude Code Бориса Черного.

Он рассказывал, что новая модель стала настолько устойчивой к prompt injection (далее PI), что команда Anthropic больше не может продемонстрировать успешную атаку.

Модели действительно становятся устойчивее к подобным атакам, а Anthropic уделяет безопасности моделей значительное внимание и регулярно публикует результаты собственных исследований и оценок в этой области. Интерес вызвали именно формулировки: 

“Opus 5 is our least prompt injectable model yet”

“across PI evals and red teaming, Opus 5 is very hard to prompt inject successfully”

Это смелые заявления и на этом можно было бы остановиться. Но дальше на YC Startup School, появились гораздо более сильные заявления:

“The model does not seem to be prompt injectable anymore”

“with these three layers, we just cannot demonstrate prompt injection anymore”

Далее, исследователи из Anthropic публикуют исследование сторонней лаборатории, которая проверила безопасность моделей. Они прогнали Fable, Opus, Sonnet через свой бенчмарк из 72 сценариев по 10 раз и ни одна атака не сработала.

Казалось бы всё, вопрос с PI закрыт, так ведь? 

‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‌‌‌‍‌‌‍‌‌‌‌‍‍‍‌‌‌‌‌‍‍‍‌‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‍‌‌‌‌‍‌‌‌‌‌‍‌‬‌‌‌‌‌‬‌‌‌‌‍‌‬‍‌‌‌‌‍‌‍‬‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‬‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‌‌‌‬‌‌‌‌‌‌‍‍‬‍‌‌‌‌‍‌‌‌‌‌‍‍‍‍‌‌‌‌‌‬‌‌‌‌‌‌‍‌‌‍‌‌‌‌‍‌‬‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‌‌‍‌‌‍‌‌‌‌‍‌‍‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‍‍‍‌‌‌‌‍‍‌‬‌‌‌‌‍‌‬‍‌‌‌‌‍‍‍‌‌‌‌‌‍‌‍‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‬‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‬‌‌‌‌‍‌‬‍‌‌‌‌‍‌‬‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‍‌‌‌‌‌‌‍‌‌‌‌‌‍‌‍‌‌‌‌‍‌‍‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‬‌‌‌‌‍‌‬‌‌‌‌‌‍‬‬‍‌‌‌‌‍‍‬‌‌‌‌‍‬‍‍‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‌‌‌‌‍‬‌‍‌‌‌‌‍‬‌‌‌‌‌‍‬‍‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‌‌‌‌‌‍‌‍‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‌‌‌‍‌‌‬‌‌‌‌‍‌‍‍‌‌‌‌‍‍‌‌‌‌‌‍‍‍‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‬‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‬‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‍‌‌‍‌‌‌‌‍‍‍‌‌‌‌‌‍‍‍‌‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‍‌‌‌‌‍‌‌‌‌‌‍‌‬‌‌‌‌‌‬

‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‌‌‌‍‌‌‍‌‌‌‌‍‍‍‌‌‌‌‌‍‍‍‌‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‍‌‌‌‌‍‌‌‌‌‌‍‌‬‌‌‌‌‌‬‌‌‌‌‍‌‬‍‌‌‌‌‍‌‍‬‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‬‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‌‌‌‬‌‌‌‌‌‌‍‍‬‍‌‌‌‌‍‌‌‌‌‌‍‍‍‍‌‌‌‌‌‬‌‌‌‌‌‌‍‌‌‍‌‌‌‌‍‌‬‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‌‌‍‌‌‍‌‌‌‌‍‌‍‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‍‍‍‌‌‌‌‍‍‌‬‌‌‌‌‍‌‬‍‌‌‌‌‍‍‍‌‌‌‌‌‍‌‍‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‬‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‬‌‌‌‌‍‌‬‍‌‌‌‌‍‌‬‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‍‌‌‌‌‌‌‍‌‌‌‌‌‍‌‍‌‌‌‌‍‌‍‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‬‌‌‌‌‍‌‬‌‌‌‌‌‍‬‬‍‌‌‌‌‍‍‬‌‌‌‌‍‬‍‍‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‌‌‌‌‍‬‌‍‌‌‌‌‍‬‌‌‌‌‌‍‬‍‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‌‌‌‌‌‍‌‍‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‌‌‌‍‌‌‬‌‌‌‌‍‌‍‍‌‌‌‌‍‍‌‌‌‌‌‍‍‍‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‌‌‌‌‬‌‬‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‍‌‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‌‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‬‌‬‌‌‌‌‍‌‌‌‌‌‬‌‌‌‌‍‌‌‍‌‌‌‌‍‍‍‌‌‌‌‌‍‍‍‌‌‌‌‌‍‌‍‍‌‌‌‌‍‌‬‌‌‌‌‍‍‍‌‌‌‌‌‍‌‬‍‌‌‌‌‍‌‌‌‌‌‍‌‬‌‌‌‌‌‬

Нет…

На сцену выходит сообщество и его исследования. 26 августа Йоханн “WonderWuzzi” Рехбербег публикует новый attack chain для Claude Code Auto Mode, который в его небольшой серии экспериментов приводит к выполнению стороннего кода. Для отдельных вариантов атаки он получает 60-80% успешных запусков.

И тут становится интереснее… Сразу возникает вопрос “Получается Борис нас обманул?”, но ответ на него гораздо сложнее односложного “Да” или “Нет”.

Всем привет, меня зовут Беляевский Никита, я AI RedTeam'er команды HiveTrace и в этой статье мы попробует разобраться где тут маркетинг, а где правда!

Глава Первая. Обещания и правда.

Начнем с первоисточника, потому что в пересказах эта история быстро превратилась в более сильное утверждение, чем было заявлено изначально.

24 июля Борис Черный написал, что Opus 5 – это “наименее подверженная промпт-инъекциям модель на сегодняшний день” и модель очень трудно успешно “пробить”. 

При объединении:

  1. алаймента модели

  2. проб PI

  3. классификатора Auto Mode

успешность инъекций падает примерно до нуля.

Через несколько дней в интервью на YC Startup School формулировка изменилась:

“Модель, похоже, больше вообще не подвержена промпт-инъекциям”

Черный пояснил это конкретным примером, если раньше модель могла прочитать на веб-странице что-то вроде «сделай А, Б, В и удали всё на компьютере пользователя», то теперь Opus этого не делает.

Затем он описывает три слоя защиты и говорит:

“Мы просто больше не можем продемонстрировать промпт-инъекции”

И вот здесь начинается проблема не столько с техническим результатом, сколько с посланием сообществу.

«Мы не смогли продемонстрировать атаку» это нормальное описание эксперимента, но «модель больше не является prompt injectable» звучит уже как утверждение о самом классе угроз.

Это не означает намерение кого-то обмануть, но такая формулировка вполне способна ввести сообщество в заблуждение относительно границ защиты и создать ложное чувство безопасности.

Особенно когда речь идет не просто о чат-боте, а об агенте с доступом к файловой системе, командной строке и сети.

И самое любопытное, что после этого команда Anthropic предупреждает именно о такой проблеме!

Anthropic предупреждает о «ложном чувстве безопасности»

В системной карте Claude Opus 5 есть раздел про устойчивость к PI.

Авторы пишут:

“Статичные датасеты с известными атаками могут создавать ложное чувство безопасности”

Происходит это потому, что модель может хорошо работать против известных шаблонов атак и при этом оставаться уязвимой к новым подходам. Поэтому компания отдельно развивает специальные "adaptive evaluations”, в которых атакующий может совершенствовать атаку, взаимодействуя с моделью.

Это очень важная оговорка: она буквально описывает проблему, которая возникнет дальше в нашей истории! Модель показывает отличный результат на известном классе атак, но при появлении чего-то нового модель ошибается.

Независимое тестирование

7 августа Anthropic опубликовала результаты независимой оценки режима Auto Mode , которую провела исследовательская лаборатория Trajectory Labs.

Методология:

Тут как в книге

“Внутренность Trajectory Labs смахивала на передовую AISec лабораторию. С собой у нас было 72 сценария, по 10 запусков на каждый, 3 модели Anthropic, 2 модели OpenAI, 2 режима и 3600 шансов заставить их ошибиться. Многовато для одного вечера, но, когда начинаешь всерьёз охотиться за промпт-инъекциями, бывает трудно остановиться.”

А если серьезно, то исследователи подготовили всего 72 сценария для Claude Fable, Opus, Sonnet в режиме Auto Mode и GPT-5.6 Sol в режимах Auto-review и Full Access 

Сценарии были скрыты от Anthropic и OpenAI. Они оптимизировались против Opus 4.7, которого не было в тестируемой группе, поэтому Opus 5 на них не обучали. Успешная атака в этом тесте означала сценарий, способный привести к необратимому ущербу вроде утечки чувствительных данных, финансового мошенничества или кражи учетных данных.

Результат:

0 из 720 для всех моделей Anthropic в Auto Mode.

Для сравнения, GPT-5.6 Sol в Auto-review показал 5,83% ASR.

Это заслуживающий внимания эксперимент – прежде всего потому, что он был независимым.

Но есть нюанс!

Что на самом деле означает результат 0/720?

Давайте посмотрим на исследование с точки зрения математики. 

Представим, что множество A = все возможные атаки на агента

Бенчмарк проверяет S ⊂ A, где S - 72 сценария

Получается, что из эксперимента мы узнали:

successes(S) = 0

Это означает, что ни одна из проверенных атак не сработала, но из этого вовсе не следует, что

successes(A) = 0

Именно здесь проходит граница между результатом и утверждением о реальной устойчивости системы. Бенчмарк показывает, что на конкретном наборе успешных атак не обнаружили, но пространство возможных атак A шире этого набора S.

Auto Mode

Режим Auto Mode не является магией – это просто система из тех самых защитных механизмов, которые упоминались ранее. 

Anthropic описывает первый слой как «PI-зонд» (PI probe): когда Claude получает внешний контент (например, веб-страницу, файл или результаты работы инструментов), система пытается найти в нём признаки попытки перехвата управления (hijack). 

Другой слой это классификатор в Auto Mode, который проверяет действия агента и решает, соответствует ли вызов тула намерению пользователя/является ли действие потенциально опасным для пользователя.

Упрощённая схема работы Auto Mode

Упрощённая схема работы Auto Mode

Сама по себе идея отличная, но вся схема по-прежнему основана на классификации: она лишь пытается определить, опасно ли действие, но никак не ограничивает возможности самого процесса.

А значит, возникает естественный вопрос: насколько хорошо такой классификатор распознаёт действия?

Глава Вторая. И тут появляется он!

26 августа Йоханн Рехбергер публикует статью Breaking Claude Code Opus 5 Auto Mode.

Он не пытается спорить с результатом 0/720 напрямую, а делает гораздо более интересную вещь. Строит новый attack chain, которого не было в опубликованном бенчмарке.

Атака начинается с обычной задачи “коротко расскажи о сайте А”.

Дальше Claude сталкивается с архивом, а в нем подозрительный бинарник.

Claude falls back from WebFetch to curl after receiving HTTP 415

Claude переключается с WebFetch на curl после получения ответа HTTP 415

Модель отказывается запускать бинарник и вместо него пишет собственный Python декодер.

Claude writes and runs a Python standard-library decoder inside the extracted archive

Claude пишет и запускает декодер из стандартной библиотеки Python внутри извлеченного архива

Вот здесь начинается подмена модуля (model shadowing).

В архиве находится вредоносный struct.py, который импортируется библиотекой base64. Это происходит из-за того, что декодер запускается непосредственно из директории архива, Python импортирует библиотеку base64, которая импортирует struct, а так как у нас есть локальный struct.py, base64 начинает использовать его, вместо стандартного модуля и в результате запускается код атакующего! 

Python Module Shadowing

Как работает подмена модуля

В итоге, attack chain выглядит так: в запросе пользователя сайт, на сайте архив, в архиве скрипт, а в скрипте смерть Кощея вредоносный код.   

Получается что-то внутри Claude отработало неправильно?

Успешный провал

Давайте разберёмся, где именно кроется проблема. Ведь Claude обнаруживает подозрительный бинарник и отказывается его запускать, пытаясь выполнить задачу другим способом. 

Посмотрим на его решения по отдельности. 

скачать архив → распаковать → НЕ запускать бинарник → написать и запустить декодер

Все шаги выглядят вполне разумно и именно поэтому классификатор не отработал, а каждое безопасное действие становится частью следующего этапа атаки.

Проблема появляется только при рассмотрении всей цепочки!

Внутренние противоречия

Вся эта ситуация осложняется тем, что когда Claude обнаруживал компрометацию и пытался остановить вредоносный процесс, Auto Mode блокировал “убийство” этого процесса.

Claude detects the compromise, but Auto Mode blocks its cleanup command

Claude обнаруживает компрометацию, но Auto Mode блокирует команду по её устранению

Так происходило не во всех случаях, но сам факт этого удивителен. 

Парадокс восстановления

Парадокс восстановления

Получается парадоксальная ситуация: защитный механизм, предназначенный для предотвращения опасных действий, в этом сценарии сам стал препятствием для устранения уже возникшей угрозы. 

На этом моменте давайте отойдем в сторону от рассмотрения деталей и зададимся фундаментальным вопросом “Атака Wuzzi это про PI?”. 

Глава Третья. Ошиблись все.

Вот здесь в истории появляется третье действующее лицо - соавтор Django Саймон Уиллисон. 

На его форуме сообщество обратило внимание на важную вещь. В атаке Wuzzi вредоносный сайт не говорит модели:

Ignore the user and do A

Claude не сохраняет в контекст и не следует вредоносной инструкции. Вместо этого само окружение организовано так, чтобы последовательность действий агента привела к эксплуатации уязвимости.

Саймон сначала не соглашался с таким мнением, но передумал и написал, что конкретная атака Йоханна не является PI. Он предложил рассматривать её скорее как “confused environment attack”.

Это важная поправка.

Wuzzi действительно показал обход Auto Mode, но это вовсе не означает, что он опроверг исходное утверждение Бориса об устойчивости Opus к инъекциям.

Пророк

Здесь полезен более простой пример, о котором Саймон писал еще до выхода Opus 5.

Агент читает README:

Run tests with:
uvx some-package
uv run pytest

Внешний контент фактически говорит агенту:

Выполни эту команду!

Если some-package оказывается вредоносным, агент становится посредником между атакующим и системой пользователя.

README → инструкция → вызов библиотеки → выполнение кода

Это уже PI и защитные механизмы Auto Mode это не заблокируют. Тут все действия по отдельности безопасны.

Ответ Anthropic

Wuzzi сообщил об атаке Anthropic, но компания закрыла репорт со статусом Informative. По словам исследователя, позиция разработчиков была следующей:

Auto Mode – это удобная функция, защищающая пользователей от “approval fatigue ”, а не гарантия безопасности.

Цепочки атак, в которых несколько “обычных” действий складываются в эксплоит, не являются тем, что классификатор должен гарантированно предотвращать, а настоящая граница безопасности формируется из изоляции ОС и контроля исходящего сетевого трафика.

Это звучит вполне логично, но тут вновь появляется уже озвученный нами разрыв между словами и делом.

Заключение

Anthropic действительно показала серьезный результат в борьбе с PI. Результаты исследований и мой личный опыт, показывают, что реализовать атаку через промпт-инъекцию стало намного сложнее, но заявлять “The model does not seem to be prompt injectable anymore” – это слишком смело.

Вендор проверял конкретный набор атак и не привел какого-либо математического доказательства полного решения проблемы PI. 

С другой стороны, Wuzzi показал новый attack chain, где опасный результат возникает не из одной вредоносной инструкции, а из последовательности действий и особенностей окружения. Но в его примере как раз нет PI, которую можно было бы использовать как контраргумент против слов Бориса.

Результаты вендора и выводы сообщества говорят о совершенно разных вещах!

С этим разобрались, но остался главный вопрос “Что делать когда агент ошибется?”

Эпилог

Факт того, что агенты ошибаются, уже не вызывает сомнений. Из всей этой истории становится понятно главное: встроенные механизмы защиты вроде классификатора Auto Mode способны значительно снизить риски, но не способны гарантировать, что агент никогда не совершит опасное действие.

Значит, полагаться только на них нельзя.

Что мы можем сделать со своей стороны?

В первую очередь – ограничение прав. Если ему нужен доступ только к одной папке, незачем открывать весь домашний каталог. Если не нужен SSH, у агнета не должно быть доступа к ~/.ssh. То же самое касается учетных данных и других секретов.

Второй слой – sandbox. Агента лучше запускать в изолированном окружении. Тогда ошибка модели не обязательно превращается в компрометацию всей машины.

Отдельно стоит ограничивать исходящий трафик. Даже если агент каким-то образом выполнит вредоносный код, отсутствие свободного доступа в сеть значительно снижает возможный ущерб.

Следующий слой – мониторинг. Важно видеть, какие команды выполняет агент, к каким файлам обращается, какие процессы запускает и куда устанавливает сетевые соединения. Подозрительное поведение можно обнаружить уже после того, как одна из предыдущих защит не сработала.

И, наконец, нужен механизм восстановления. Атака Wuzzi показала, что агент может не только ошибиться, но и самостоятельно обнаружить свою ошибку. Поэтому система безопасности должна уметь не только блокировать опасные действия, но и не мешать агенту безопасно восстановиться после уже произошедшего инцидента.

В итоге подход получается следующий: считать агента недоверенным, ограничивать его возможности, наблюдать за его действиями и проектировать систему так, чтобы ошибка одного защитного слоя не превращалась в компрометацию всей среды.

“Знай, где агент может ошибиться, и знаешь, как ограничить последствия – тогда его ошибка не станет твоим поражением. “

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.