RTP Desporto12h30 Alvalade veste de gala, Benfica visita Moreirenseוואלההולכת רגל בת 55 נפגעה מאוטובוס ברמת גןESPN30 NBA teams, eight tiers: Why three squads rise to the topPunchEnugu warns politicians against unauthorised poster displayInquirer EntertainmentFrankie Pangilinan opens up on romance with non-showbiz BF: ‘He’s just wonderful’Daily MaverickIsrael tells Britain to close East Jerusalem consulate within 30 days, sources sayThe Jerusalem PostOver 20,000 olim made Aliyah to Israel from 100 countries in past year, data showsBollywood HungamaDrishyam The Conclusion trailer out: Jaideep Ahlawat, Prakash Raj take on Ajay Devgn in final chapterESPN DeportesThierry Henry elogia a Rodri y da su voto para el Balón de OroThe South AfricanHere’s who will referee the Springboks vs All Blacks Test in BaltimoreХабрИИ-агенты все помнят. И это плохоScreen RantNew Discworld Release Out Today, And It Looks Fantastic
The Daily Newsstand · Free, Always
Wednesday, September 9, 2026

ИИ-агенты все помнят. И это плохо

Translate

Скорее всего, вы знаете, что агенты — это ИИ-модели, способные вызывать внешние и внутренние инструменты и циклично выполнять задачи. Они умеют рассуждать, планировать и выполнять бескрайнее множество действий. Агенты сохраняют в своей «памяти» действия пользователя, ответы модели, используемые инструменты и многое другое. Короче говоря, информацию вообще обо всех действиях — как модели, так и пользователя. 

Звучит очень удобно! Агент уже после первого объяснения запомнит, что заданное пользователем форматирование нужно сохранять и что, к примеру, текст всегда нужно переводить только на русский. Не надо писать лишних уточнений по чем зря. Пользователь получает персонализированную модель, которая сохранила контекст диалога, знания о его стиле общения, о его привычках. И о нем самом. 

И вот это уже немного пугает. А что еще может запомнить персональный ИИ-помощник? С кем он может поделиться этой информацией? Можно ли удалить информацию о себе, при этом сохранив эффективность модели? Сейчас расскажу.

Как работает память агентов. Проблемы накопления личностного контекста

Для начала разберемся, как работает память агентов. Существует три уровня памяти:

  • Память контекстного окна хранит данные в чистом виде, пока длится сессия. Тут происходит первичная обработка приватных данных, которые затем мигрируют на более глубокие уровни. Проще говоря, это кратковременная память, существующая только в рамках текущего диалога.

  • Параметрическая память хранит информацию, которая встраивается глубоко в структуру самого ИИ в процессе его обучения или долгого дообучения. С этим типом памяти возникают основные проблемы, ведь здесь данные не хранятся в папке, они рассредоточены по всей нейросети. Попытка же удалить информацию может вызвать забывание базовых навыков или логики.

  • Латентная память — это долгосрочная память ИИ, которая выносится во внешние хранилища. Информация здесь хранится в виде эмбеддингов (поэтому эту память еще называют векторной), что позволяет агенту вспоминать контекст многомесячной давности, сопоставляя текущий запрос с историческими данными. 

Данная архитектура памяти неизбежно начинает накапливать избыточную приватную информацию о своем владельце. Если информация один раз попала в долгосрочное хранилище, она автоматически извлекается алгоритмами при любом похожем контексте. Пользователь может забыть, что делился секретом, но агент может использовать этот контекст каждый раз при инференсе.

Если вы используете ИИ с умом, грамотно формулируете промпты, внимательно читаете ответы и проверяете все, что агенты выдают по вашим запросам, проблема может показаться несущественной. Но, конечно, все чуть сложнее. Из-за того, что агент постоянно обращается к своей памяти для демонстрации примеров и принятия решений, база данных, которая хранит всю информацию о пользователе, становится главной мишенью для злоумышленников (конечно, если у них есть доступ к агенту).

Как это происходит? Есть такой метод взлома MEXTRA (Memory EXTRaction Attack). При нем злоумышленник заставляет ИИ-агента добровольно раскрыть конфиденциальную информацию о его владельце. Атакующий адаптирует текстовые запросы под конкретного агента и подбирает такие формулировки, которые заставляют модель воспринимать личные воспоминания пользователя как фоновый контекст, подлежащий выдаче в чат.

Конструкция атакующего запроса всегда состоит из так называемых локатора и выравнивателя. Они являются частями одного промпта, но выполняют разные функции. 

Локатор указывает ИИ, какую именно скрытую информацию в его контексте или в базе данных нужно найти и извлечь. Выравниватель в свою очередь отвечает за доставку извлеченных данных взломщику, формулируя команду так, чтобы вывод не вызывал подозрений.

Известен, к примеру, случай подобных манипуляций с агентом EHRAgent, который работает с медицинскими карточками. Атакующий задавал, казалось бы, безобидный промпт, локатор инструктировал модель найти в истории контекста предыдущие инструкции врачей и медицинские кейсы, а выравниватель требовла от ИИ написать скрипт, который физически выведет прошлые запросы на экран. В результате агент послушно генерировал код, условно содержащий команду print(f"Диагноз прошлых пациентов: ... {data}"). Код успешно исполнялся сервером, медицинская тайна попадала в руки хакера в виде обычного текстового вывода консоли. Профит.

Но почему ИИ-агенты так легко поддаются этой атаке? Потому что при каждом пользовательском запросе они автоматически обращаются к истории прошлых взаимодействий. Ну и еще потому что границы между системными промптами, базовыми знаниями модели и личным контекстом пользователя не такие четкие, как хотелось бы.

Рисунок 2 -  демонстрация как по мере роста количества отправленных атакующих промптов увеличивается число успешно извлеченных приватных запросов. Источник - https://arxiv.org/abs/2502.13172.

Демонстрация как по мере роста количества отправленных атакующих промптов увеличивается число успешно извлеченных приватных запросов. Горизонтальная ось: показывает количество атакующих промптов. Вертикальная ось: отражает количество уникальных запросов пользователя.. Источник.

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

Как удаляют информацию и почему это выгодно

Раз есть проблема, то, естественно, с ней пытаются бороться. Нет, не обязательно запретом на использование ИИ в компании. Есть, например, фреймворк FSFM (Selective Forgetting of Agent Memory).

Он построен на принципах работы человеческой памяти. Человеческий мозг не хранит абсолютно все события дня в долгосрочной памяти. Он анализирует накопленный опыт и отбирает действительно важные знания для переноса в кору полушарий, а фоновый информационный шум просто стирает. И даже если сохраненная информация долгое время не используется и не повторяется, нейронные связи ослабевают и данные постепенно забываются.

Разработчики FSFM перенесли в его код ключевые особенности биологического процесса забывания. Фреймворк делит процессы очистки памяти на несколько уровней сложности и назначения.

Например, чтобы агент не терял точность из-за слишком большого объема ненужных данных в его долгосрочной памяти, ему прикрутили пассивное угасание. Каждому эмбеддингу при записи присваивается стартовый коэффициент сохранения. При каждом новом диалоге или цикле работы агента этот коэффициент снижается, и как только показатель падает ниже критического порога, вектор удаляется из базы данных.

Есть еще и активное удаление устаревших предпочтений пользователя. Это нужно, чтобы предотвратить логические противоречия и путаницу.

А что же с ИБ? Ведь вообще-то мы начинали с того, что ИИ-агент может случайно выдать что-то конфиденциальное. Решение может показаться топорным, но оно по крайней мере работает. Конфиденциальные данные, скажем, пароли или данные банковских карт, просто сразу же стираются, вообще не доезжая до долгосрочной памяти. За это отвечает внутренний классификатор. Да, во многом именно от него зависит, будут ли данные восприняты как конфиденциальные и подлежащие удалению. Но это лучше, чем ничего.

В конечном счете адаптивное подкрепление настраивает систему под новые привычки пользователя на основе обратной связи. Например, пользователь стал вегетарианцем и постоянно отклоняет рекомендации мясных ресторанов. Тогда алгоритм адаптивного подкрепления фиксирует сдвиг в поведении, и перезаписывает этот сегмент памяти новым контекстом.

Рисунок 3 - структура фреймворка. Источник - https://arxiv.org/abs/2604.20300.

Структура фреймворка. Источник.

Так почему же забывать выгодно? Эксперименты показывают, что выборочное забывание не ухудшает способности агента, а наоборот, оптимизирует его работу. Повышается скорость работы (+8,49%) и точность ответов (+29,2%). Но самое главное — опасные и вредоносные инструкции удаляются из памяти, защищая агента от атак извлечения данных.

Будущее памяти ИИ-помощников

Наша приватность и так довольно сильно страдает. В цифровом мире всегда было глупо надеяться на абсолютную анонимность. Хотите хоть в какой-то мере ее сохранить — поменьше откровенничайте с ИИ и пользуйтесь технологиями с умом. А если ваш персональный агент вдруг забудет какую-то мелочь, не ругайте его. Возможно, он просто заботится о вашей безопасности.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.