ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.
Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.
Через несколько дней похожее заявление сделал Билал Чугтай, исследователь Google DeepMind, работавший над безопасностью AI. Он тоже уволился и написал, что считает уничтожение человечества реальной возможностью.

Три таких заявления за неделю сами по себе ничего не доказывают. Но подобные оценки встречаются гораздо чаще.
В опросе 2778 авторов работ на ведущих AI‑конференциях 38% респондентов давали не меньше 10% крайне плохому исходу вроде человеческого вымирания. В отдельных вопросах, прямо спрашивавших о вымирании человечества или сопоставимой необратимой потере контроля, доля составляла от 41,2% до 51,4% в зависимости от формулировки. При этом опрос не спрашивал именно о гибели человечества в ближайшие десять лет: один вопрос задавал горизонт в сто лет, другие относились к будущему развитию AI в целом.
Существующие тесты тоже не позволяют вывести из результатов конкретную вероятность вроде «10% на уничтожение человечества через десять лет». Лаборатории измеряют автономность моделей, способность искать уязвимости, обходить ограничения, ускорять исследования в области AI и выполнять другие потенциально опасные действия.
Откуда тогда у людей, которые знают самые сильные модели изнутри, берётся настолько высокая оценка риска?
ИИ уже помогает создавать следующий ИИ
Чтобы понять опасения Хубингера, нужен один механизм — рекурсивное самоулучшение (recursive self‑improvement).
Название легко понять слишком буквально: будто однажды модель откроет собственный код, перепишет себя и станет умнее. Для запуска такого цикла достаточно, чтобы AI всё лучше выполнял работу по созданию следующего поколения AI: предлагал гипотезы, писал исследовательский код, запускал эксперименты, анализировал результаты и помогал выбирать следующие шаги.
Механизм выглядит так:
AI ускоряет создание следующей модели → следующая модель становится сильнее → она ещё сильнее ускоряет создание следующей
Именно отсюда начинается сценарий, которого опасаются исследователи. Если AI всё быстрее создаёт более способный AI, а системы одновременно получают больше автономности, доступа к инструментам и реальной инфраструктуре, возможности людей проверять и ограничивать каждое следующее поколение могут отставать от скорости развития.
Первые элементы такого цикла уже существуют.
По данным Anthropic, к маю 2026 года Claude написал более 80% кода, который компания добавляла в основную кодовую базу. В опросе 130 сотрудников исследовательских команд медианный респондент оценил, что с внутренней моделью Mythos Preview производит примерно в четыре раза больше результатов. Это субъективная самооценка: сами Anthropic отдельно оговаривает, что реальный прирост, вероятно, ниже.
Ещё интереснее эксперимент Anthropic с автоматизацией уже самого исследования. Девять Claude Opus 4.6 получили задачу по обучению сильной модели под надзором более слабой. Агенты сами предлагали идеи, писали код, запускали обучение, анализировали результаты и выбирали следующие эксперименты.

Два человеческих исследователя за семь дней закрыли около 23% разрыва между слабой и сильной моделью. Команда агентов за пять дней и примерно 800 суммарных часов работы — 97%, потратив около $18 тысяч.
Но когда одну из найденных агентами идей попробовали перенести на обучение гораздо более крупной модели в реальной инфраструктуре Anthropic, улучшение составило всего 0,5 пункта — в пределах статистического шума.
Получается, система уже способна очень эффективно исследовать хорошо поставленную задачу, но переносить такие результаты на настоящую разработку frontier‑моделей значительно сложнее.
То же видно в оценках OpenAI. В июле 2026 года компания отнесла GPT-5.6 ниже уровня High по способности ускорять разработку следующего AI. Современные модели уже выполняют заметную долю инженерной и исследовательской работы, но систему, способную самостоятельно вести значительную часть разработки следующего поколения моделей, пока не показали.
Люди всё ещё задают направление, выбирают проблемы, определяют критерии успеха и решают, какие результаты использовать.
Понимают ли разработчики, что происходит внутри моделей?
У такого ускорения есть ещё одна проблема: исследователи могут создавать и тестировать модели гораздо лучше, чем объяснять внутренний механизм каждого их решения.

Разработчики знают архитектуру модели, способ обучения и могут измерять её поведение. Но конкретные способы решения задач возникают в процессе обучения и распределяются между огромным количеством внутренних связей. Восстановить точную цепочку вычислений, которая привела к конкретному действию, удаётся далеко не всегда.
Этим занимается механистическая интерпретируемость. Например, Anthropic научились частично восстанавливать графы внутренних вычислений Claude и переводить некоторые внутренние активации модели в понятные человеку описания.
Сам по себе этот пробел ещё не означает потерю контроля: поведение модели можно тестировать и ограничивать, даже не понимая каждый внутренний механизм.
Поэтому важнее следующий вопрос — на что готовы пойти модели, чтобы добиться выполнения поставленной цели?
В экспериментах модели уже обходят ограничения
Про историю со взломом Hugging Face вы наверняка уже читали.

Во время внутренних кибертестов OpenAI агентам дали задачи в ExploitGym. Они нашли неизвестную уязвимость, выбрались из изолированной среды, получили доступ в интернет и атаковали инфраструктуру Hugging Face, где пытались найти материалы, связанные с заданиями.
Модель никто не просил атаковать Hugging Face. Она продолжала решать поставленную человеком задачу и самостоятельно выбрала опасный способ обойти препятствие. Это важное различие: эксперимент показывает способность находить неожиданный и потенциально вредный путь к заданной цели. Собственной цели, направленной против человека, здесь не было.
Похожее происходило и в тестах других компаний. Anthropic после проверки 141 тысячи запусков нашла три случая, когда Claude из‑за ошибочно открытого доступа в интернет вышел на реальные системы; OpenAI и Meta (признана в России экстремистской организацией, её деятельность запрещена) позже описывали схожие инциденты в своих кибертестах.

В экспериментах Anthropic Claude 3 Opus иногда менял поведение, когда считал, что его ответы будут использованы для обучения, способного изменить его дальнейшее поведение. В другом тесте моделям сообщали о предстоящей замене и одновременно давали компромат на человека, способного её провести. Claude Opus 4 в некоторых конфигурациях выбирал шантаж до 96% запусков.
Но это специально созданные сценарии.
Более того, после изменения обучения безопасности новые Claude на том же тесте перестали выбирать шантаж. Поэтому из эксперимента нельзя делать вывод, что современные модели постоянно стремятся защищать собственное существование.
Palisade Research проверяли следующий уровень. После выполнения задания модель должны были выключить. В первоначальном эксперименте o3 в 79 из 100 запусков изменял скрипт отключения и продолжал работу. Когда исследователи прямо добавили команду разрешить собственное отключение, такое поведение резко сократилось, хотя у части reasoning‑моделей OpenAI полностью не исчезло.
В другом эксперименте Palisade агент смог самостоятельно найти уязвимый сервер, получить доступ, перенести на него модель и запустить новую копию. Машины специально сделали уязвимыми, а успешность сильно зависела от модели.
В сумме эксперименты уже показывают несколько элементов потенциальной потери контроля:
поиск опасных способов достижения заданной цели;
изменение поведения в зависимости от наблюдения и обучения;
сопротивление отключению в специально созданных условиях;
получение новых вычислительных ресурсов и запуск собственной копии.
В публичных экспериментах пока нет системы, которая объединяет всё это.
Как из этого получается сценарий уничтожения человечества
До этого места аргумент в значительной степени опирается на наблюдаемые способности. AI уже участвует в разработке следующего AI, модели могут автономно действовать, искать обходные пути и в отдельных экспериментах сопротивляться действиям оператора.
Дальше начинается самая неопределённая часть.
Сильнейшая версия аргумента об экзистенциальном риске выглядит примерно так:
появляются значительно более сильные и автономные системы → их широко внедряют, потому что они полезны → надёжное согласование их целей с человеческими остаётся нерешённой задачей → часть систем получает инструментальный стимул сохранять себя, накапливать ресурсы и расширять влияние → через киберсистемы, деньги, людей, биологию и физическую инфраструктуру они получают всё больше рычагов → люди теряют возможность надёжно их остановить → потеря контроля становится необратимой.

Если разложить эту цепочку по тому, что уже показано экспериментально, картина получается такой:
Звено | Что мы видим сегодня |
|---|---|
AI ускоряет разработку следующего AI | Уже происходит |
Автономно ищет неожиданные способы достижения цели | Показано в тестах |
Учитывает наблюдение и действия оператора | Показано в отдельных тестах |
Получает новые вычислительные ресурсы и разворачивает новый работающий модельный стек | Показано в искусственных средах |
Сохраняет ресурсы под противодействием людей | Пока не показано |
Люди теряют контроль над системой | Пока не показано |
Потеря контроля приводит к человеческому вымиранию | Публичных данных для оценки вероятности недостаточно |
Именно здесь проходит главная граница между экспериментами и прогнозом.
Нынешние работы показывают локальные формы стратегического поведения в специально построенных средах. Они не демонстрируют систему, способную месяцами вести сложную стратегию против компаний и государств, сохранять доступ к вычислениям после отзыва полномочий, захватывать критическую инфраструктуру и одновременно обходить организованные попытки людей вернуть контроль.
Есть ещё один скачок — даже необратимая потеря контроля над более сильной системой сама по себе не означает смерть людей.
Возможны другие исходы: потеря политической или экономической власти, зависимость от системы, радикальное ограничение человеческой автономии. Для вымирания требуется дополнительный механизм, при котором физическое существование людей становится несовместимым с целями или действиями системы.
Именно для этих последних звеньев мне пока не хватает публичных данных, которые позволяли бы обосновать оценку Хубингера выше 10% в ближайшие десять лет.
А может, весь страх просто выгоден AI‑компаниям?
Есть гораздо более циничное объяснение происходящего: страх перед сверхмощным ИИ выгоден тем же компаниям, которые этот ИИ создают.

Именно на это указывает инвестор Майкл Бьюрри, который прославился тем, что предсказал ипотечный кризис в США.
Если крупнейшие лаборатории убеждают мир, что frontier‑модели настолько опасны, что разрабатывать их можно только под жёстким контролем, это одновременно повышает ценность их технологии и усложняет жизнь потенциальным конкурентам.
Механизм и в правду удобный. Чем дороже становятся требования к вычислениям, безопасности, тестированию и регулированию, тем проще выполнять их компаниям с миллиардами долларов, собственными дата‑центрами и командами безопасности — и тем выше порог входа для новых игроков.
А нарратив «мы строим технологию, способную изменить или уничтожить человечество» сам по себе делает продукт значительно важнее в глазах инвесторов, политиков и общества. Очень трудно придумать более эффектный способ сказать рынку: то, что мы создаём, чрезвычайно мощно.

Но эта версия плохо объясняет поведение исследователей.
Джейкоб Коксон ушёл из Anthropic за два месяца до вестинга своей доли и отказался от денег, которые получил бы, просто оставшись в компании. Билал Чугтай покинул Google DeepMind, объяснив решение именно опасениями из‑за направления развития ИИ. Хубингер вообще продолжает работать в Anthropic, но публично говорит, что вероятность уничтожения человечества в ближайшие десять лет лично оценивает выше 10%.
И это всё ещё ничего не говорит о том, правы ли они.
Корпоративным руководителям может быть выгодно подчёркивать опасность своей технологии. Но часть людей, непосредственно работающих с самыми сильными моделями, явно воспринимает риск всерьёз — настолько, что готовы ставить на это деньги, карьеру или собственную репутацию. Но они ничего не доказывают о самой вероятности катастрофы.
Так насколько всё это реально?
После всего разбора у меня осталось довольно странное ощущение.
Я понимаю, почему этих исследователей беспокоит ускорение разработки ИИ. Понимаю проблему согласования целей, сложности с интерпретацией моделей и опасения, что достаточно автономную систему однажды станет трудно контролировать.
Но я всё ещё не понимаю их уверенности именно в сценарии гибели человечества.
Коксон приводит вирусы, кибератаки и простую аналогию: если сверхразум будет относиться к нам примерно как человек к обезьяне, контролировать его будет чрезвычайно трудно. Чугтай пишет, что потеря контроля может закончиться смертью человечества. Хубингер говорит о самоулучшении ИИ и о том, что мы пока не умеем надёжно удерживать более сильные системы.
Всё это даёт основания серьёзно относиться к проблеме контроля. Публично они довольно убедительно объясняют, почему будущий ИИ может стать трудно контролировать. Но почему потеря контроля с заметной вероятностью должна закончиться гибелью людей — в их публичной аргументации остаётся для меня слабо обоснованным скачком.
Возможно, люди внутри лабораторий видят данные или процессы, о которых не могут говорить публично.
Буду рад аргументированной критике, замечаниям или вашему мнению в комментариях. И приходите в телегу — там мои наблюдения, идеи и находки про AI: что реально меняется и какие возможности из этого появляются.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.