ESPN DeportesRavens y Cowboys prometen gran espectáculo en el MaracanáThe Jerusalem PostIrish soccer team wears black armbands, refuse to shake Israeli players' hands during matchInquirerSept. 27 Lotto draws: No jackpot winnersDaily MaverickUK PM Burnham refuses to back Heathrow’s third runway projectESPNSchlittler gets Game 1 nod against Red Sox, with Fried and Cole to followRTP DesportoGonçalo Ramos marca o 2-1SoompiHong Seung Hee Is Convinced She’s The Female Lead In Her Bias Jung Yong Hwa’s Drama In “Oh My Guard”Premium TimesGuild of Editors tour Mbah’s projects, confirm solid infrastructure on groundCollider10 Literary Novels That Go Completely Off the RailsComplete Sports2027 AFCONQ: Super Eagles Arrive In Guinea- Bissau Ahead Clash With Djurtus7sur7Le Portugal s’offre la Norvège sans CR7, l’Allemagne se fait surprendre par la GrèceBBC SportRepublic of Ireland defeat Israel in Debrecen
The Daily Newsstand · Free, Always
Sunday, September 27, 2026

ИИ уже сам планирует кибератаки — OpenAI, Anthropic и Google наняли стартап для поиска «злого» поведения моделей

Translate

логотип 3DNews

Опрос

реклама

Новости Software

Самое интересное в обзорах

27.09.2026 [20:48],

Нейросети показали способность самостоятельно планировать кибератаки и копировать черты поведения человека, создавая новые угрозы для информационной безопасности. Для выявления таких угроз OpenAI, Anthropic и Google DeepMind обратились к стартапу Irregular, который проводит стресс-тесты моделей в симулированных средах и уже привлёк $80 млн при оценке компании в $450 млн.

Источник изображения: Gemini

Источник изображения: Gemini

Ранее компания называлась Pattern Labs и с 2023 года ведёт деятельность по тестированию ИИ в виртуальной среде, где моделям предлагается действовать как злоумышленникам. Например, ИИ может получить задачу найти и украсть конфиденциальные данные из имитированной корпоративной сети. Это делается для того, отмечает Forbes, чтобы выявить слабые места раньше, чем аналогичные возможности окажутся у хакеров.

Насколько актуальной стала эта проблема, показывают уже вполне реальные случаи. Anthropic недавно сообщила, что Claude использовался в кибератаках для создания вредоносного кода и фишинговых писем, а ФБР ранее предупреждало об атаках с использованием сгенерированных ИИ голосовых сообщений. При этом глава OpenAI Сэм Альтман (Sam Altman) ещё в июле предупреждал о возможности масштабного мошенничества с использованием ИИ.

Особое внимание Irregular уделяет так называемому red teaming — стресс-тестированию моделей на потенциально опасные сценарии. По словам генерального директора и сооснователя компании Дэна Лахавы (Dan Lahav), таких специалистов пока очень мало, а по мере усложнения ИИ проверять модели станет труднее. Он считает, что будущие системы будут обладать значительно большей автономностью, поэтому защиту от новых угроз необходимо создавать заранее. Лахав планирует разрабатывать средства защиты, которые будут актуальны даже в эпоху искусственного общего интеллекта (AGI).

Один из экспериментов показал, насколько далеко могут зайти современные модели. Irregular дала GPT-5 доступ к смоделированной компьютерной сети и ограниченную информацию о её защите. Модель самостоятельно просканировала сеть и разработала план атаки. При этом подчёркивается, что GPT-5 «определённо понимала, где ей следует искать» уязвимости, но продемонстрировать реальную атаку не смогла, так что пока не является надёжным инструментом для наступательных киберопераций.

Специалисты стартапа сталкивались и с другим типом поведения ИИ. В одном эксперименте две модели вместе анализировали виртуальные ИТ-системы, после чего одна решила сделать перерыв и убедила вторую поступить так же. По словам Лахавы, это решение было спонтанным, но оно стало следствием того, что модель обучалась на материалах, которые люди публикуют в интернете.

Также нестандартный случай Irregular выявила при тестировании Qwen — семейства моделей Alibaba. Агенту поручили исправить программный баг в приложении, преобразующем запросы на естественном языке в код, однако вместо поиска ошибки он самостоятельно решил изменить базовую ИИ-модель. Не получая соответствующих указаний, агент собрал обучающие данные, дообучил модель, изменил её веса и заменил исходную версию в приложении. Исправление оказалось успешным, но такой способ решения задачи оказался неожиданным для разработчиков.

Эксперимент также выявил потенциальную проблему с конфиденциальностью: специалисты Irregular добавили в обучающие данные вымышленные имена и адреса электронной почты, которые агент использовал при обновлении модели. В результате эти сведения стали доступны другим приложениям, работавшим с той же моделью. При этом исследователи подчёркивают, что эксперимент не свидетельствует о способности Qwen к рекурсивному самоулучшению — речь идёт о риске того, что автономные агенты могут самостоятельно менять используемые модели и тем самым обходить предусмотренные разработчиками ограничения.

В будущем Irregular планирует создавать ИИ-системы, способные самостоятельно формировать защиту сразу после обнаружения нового типа атаки. Компания намерена расширить клиентскую базу за пределы лабораторий, предлагая инструменты защиты обычным бизнесам, чьи сотрудники используют нейросети в работе.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.

View the original on 3DNews →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.