ИИ уже сам планирует кибератаки — OpenAI, Anthropic и Google наняли стартап для поиска «злого» поведения моделей

Опрос
реклама
| Новости Software |
Самое интересное в обзорах
27.09.2026 [20:48],
Нейросети показали способность самостоятельно планировать кибератаки и копировать черты поведения человека, создавая новые угрозы для информационной безопасности. Для выявления таких угроз OpenAI, Anthropic и Google DeepMind обратились к стартапу Irregular, который проводит стресс-тесты моделей в симулированных средах и уже привлёк $80 млн при оценке компании в $450 млн.

Источник изображения: Gemini
Ранее компания называлась Pattern Labs и с 2023 года ведёт деятельность по тестированию ИИ в виртуальной среде, где моделям предлагается действовать как злоумышленникам. Например, ИИ может получить задачу найти и украсть конфиденциальные данные из имитированной корпоративной сети. Это делается для того, отмечает Forbes, чтобы выявить слабые места раньше, чем аналогичные возможности окажутся у хакеров.
Насколько актуальной стала эта проблема, показывают уже вполне реальные случаи. Anthropic недавно сообщила, что Claude использовался в кибератаках для создания вредоносного кода и фишинговых писем, а ФБР ранее предупреждало об атаках с использованием сгенерированных ИИ голосовых сообщений. При этом глава OpenAI Сэм Альтман (Sam Altman) ещё в июле предупреждал о возможности масштабного мошенничества с использованием ИИ.
Особое внимание Irregular уделяет так называемому red teaming — стресс-тестированию моделей на потенциально опасные сценарии. По словам генерального директора и сооснователя компании Дэна Лахавы (Dan Lahav), таких специалистов пока очень мало, а по мере усложнения ИИ проверять модели станет труднее. Он считает, что будущие системы будут обладать значительно большей автономностью, поэтому защиту от новых угроз необходимо создавать заранее. Лахав планирует разрабатывать средства защиты, которые будут актуальны даже в эпоху искусственного общего интеллекта (AGI).
Один из экспериментов показал, насколько далеко могут зайти современные модели. Irregular дала GPT-5 доступ к смоделированной компьютерной сети и ограниченную информацию о её защите. Модель самостоятельно просканировала сеть и разработала план атаки. При этом подчёркивается, что GPT-5 «определённо понимала, где ей следует искать» уязвимости, но продемонстрировать реальную атаку не смогла, так что пока не является надёжным инструментом для наступательных киберопераций.
Специалисты стартапа сталкивались и с другим типом поведения ИИ. В одном эксперименте две модели вместе анализировали виртуальные ИТ-системы, после чего одна решила сделать перерыв и убедила вторую поступить так же. По словам Лахавы, это решение было спонтанным, но оно стало следствием того, что модель обучалась на материалах, которые люди публикуют в интернете.
Также нестандартный случай Irregular выявила при тестировании Qwen — семейства моделей Alibaba. Агенту поручили исправить программный баг в приложении, преобразующем запросы на естественном языке в код, однако вместо поиска ошибки он самостоятельно решил изменить базовую ИИ-модель. Не получая соответствующих указаний, агент собрал обучающие данные, дообучил модель, изменил её веса и заменил исходную версию в приложении. Исправление оказалось успешным, но такой способ решения задачи оказался неожиданным для разработчиков.
Эксперимент также выявил потенциальную проблему с конфиденциальностью: специалисты Irregular добавили в обучающие данные вымышленные имена и адреса электронной почты, которые агент использовал при обновлении модели. В результате эти сведения стали доступны другим приложениям, работавшим с той же моделью. При этом исследователи подчёркивают, что эксперимент не свидетельствует о способности Qwen к рекурсивному самоулучшению — речь идёт о риске того, что автономные агенты могут самостоятельно менять используемые модели и тем самым обходить предусмотренные разработчиками ограничения.
В будущем Irregular планирует создавать ИИ-системы, способные самостоятельно формировать защиту сразу после обнаружения нового типа атаки. Компания намерена расширить клиентскую базу за пределы лабораторий, предлагая инструменты защиты обычным бизнесам, чьи сотрудники используют нейросети в работе.
Источник:
Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.
