Что за зверь «internal OpenAI model» и почему DeepSeek догоняет OpenAI?

Публике не доступны внутренние модели фронтиер лабораторий. Я не очень верю про конспирологию в духе «у OpenAI в подвале сидит настоящий AGI, а наружу выдают обрезанный ChatGPT». Модель, которой пользуются её собственные исследователи, и модель, которую она продает вам через API, не обязаны быть одной и той же. Фронтиер лаба создает не одну нейросеть, а фабрику моделей: research-чекпоинты > экспериментальные модели > reward-модели > модели-учителя > модели для генерации синтетических данных > модели-evaluators > дистиллированные студенты > production-модели, и наружу попадает только последний элемент цепочки.
Зачем нужна дистилляция
Допустим, вы обучили чудовищно дорогую модель, которая хорошо рассуждает, пишет код и решает математику, но каждый запрос к ней стоит огромных вычислений. Для исследователя внутри компании это рабочий инструмент, и он того стоит, если на кону триллионные рынки. Для продукта со 100 млн пользователей масштабировать доступ к таким моделям выгодно, поэтому вместо того чтобы гонять её на каждом запросе, её делают учителем: она генерирует качественные ответы, решения, траектории ризонинга, синтетические данные, иногда сами распределения вероятностей, а на этом поведении обучается студент поменьше, которому не нужно воспроизводить учителя целиком, достаточно перенести нужные возможности. Это одна из форм дистилляции знаний, и практика настолько распространенная, что OpenAI прямо предоставляет разработчикам официальный Model Distillation workflow: брать ответы более сильной модели, например GPT-4o или o1-preview, и обучать на них модель дешевле. Формулировка самой OpenAI довольно точная: взять продвинутую модель и получить сопоставимое качество на конкретной задаче при существенно меньшей стоимости. Из этого следует довольно простая вещь: лучшая research-модель и лучшая production-модель оптимизируются по разным функциям, потому что research-модель максимизирует возможности, а production-модель приходится одновременно вытягивать по intelligence, latency, стоимости GPU, throughput, reliability и safety.
Публичных примеров такой схемы за последние два года накопилось довольно много. Apple описывала внутреннего Mixture-of-Experts учителя, которого использовала при обучении своей небольшой on-device foundation model. Google обучала EmbeddingGemma с помощью более мощного учителя Gemini. Meta использовала логиты Llama 3.1 8B и 70B при создании маленьких Llama 3.2 1B и 3B. Microsoft прямо писала, что ранние Phi в значительной степени дистиллировали возможности GPT-4. DeepSeek после обучения R1 выпустила линейку дистиллированных моделей от 1.5B до 70B. Схема «сильный учитель > дешёвый студент» реальна и хорошо задокументирована.
Чего отсюда не следует
Здесь будто бы следует неправильный вывод: якобы любая публичная модель является урезанной версией секретной супермодели. Иногда учитель вообще публичный, Meta использовала публичные Llama 3.1, DeepSeek выложила и большую R1, и дистиллированные из нее модели, причём студент иногда обходит своего учителя на конкретном бенче или узкой задаче за счет специализации и пост-трейнинга. То есть не совсем верно утверждать, что весь open source является специально ухудшенной дистилляцией секретных моделей. А вот более слабое утверждение подтверждается вполне: публичный каталог моделей почти наверняка не показывает весь фронтиер возможностей конкретной лаборатории.
«An internal model at OpenAI»
В 2026 году в математических статьях начала регулярно появляться очень необычная формулировка. 31 марта группа математиков опубликовала работу с решениями трёх задач Эрдёша, где в abstract прямо написано: “in each case, the proof is due entirely to an internal model at OpenAI.” Это не единичный случай: в феврале внутренняя модель OpenAI построила новое решение задачи Эрдёша, Нешетрила и Рёдля, в апреле вышла ещё одна работа с пятью доказательствами, полученными таким же образом, а затем внутренняя модель OpenAI нашла контрпример к гипотезе Эрдёша о unit distances, открытой около восьмидесяти лет, и доказательство проверили внешние математики. В сопутствующей статье указано, что первоначальный математический результат был сгенерирован в один проход внутренней моделью, после чего люди переработали изложение через Codex. W. T. Gowers написал, что если бы такое доказательство прислал человек, он без колебаний рекомендовал бы его к публикации в Annals of Mathematics. Mehtaab Sawhney в Twitter сформулировал это ровно так: “the solution was found by an internal model at OpenAI”, а Kevin Weil, тогда один из руководителей OpenAI, репостнул с комментарием, что AI решает всё больше открытых задач и доказательства становятся элегантнее по мере улучшения моделей. То есть существование моделей, которыми компания пользуется внутри задолго до публичного релиза, здесь уже не спекуляция, оно написано в математических статьях.
При этом несколько месяцев спустя Noam Brown из OpenAI рассказывал эту историю иначе, чем ее обычно пересказывают: компания просто обучила новую внутреннюю модель и решила посмотреть, что она умеет, контрпример нашёлся при относительно небольшом бюджете на инференс, но после публикации люди обнаружили, что примерно тот же путь вытаскивается и из уже публичной GPT-5.5, если правильно построить scaffolding. Значит, между «внутренняя модель умеет это» и «публичная модель не умеет этого» жёсткой границы может не быть вовсе: возможность уже находится внутри публичных весов, но остается латентной, пока не подобран правильный prompt, search strategy, верифайер или test-time compute. Отсюда следует, что «насколько умна модель» перестает быть свойством одних только весов и становится свойством связки модель + scaffolding + инструменты + бюджет на инференс + верифайер + search strategy + пост-трейнинг, а обычный чат-интерфейс оказывается довольно плохим прибором для измерения реального фронтиера возможностей.
Что тогда с Astra
С Astra получился почти естественный эксперимент. До публичного релиза OpenAI уже использовала очень сильные внутренние модели в research, а 3 сентября 2026 года выпустила GPT-6 Astra и назвала её the most capable broadly deployed model: 98% на FrontierMath Tier 4 и, по заявлению компании, участие в решении давних математических задач. Вполне возможно, что то, что несколько месяцев назад в статье называлось просто внутренней моделью, относится к той же технологической линии, которая позже стала Astra. Но это мой вывод по косвенным признакам: OpenAI не раскрыла происхождение этих чекпойнтов настолько подробно, чтобы можно было честно провести стрелку от конкретной внутренней математической модели к Astra. Тем более из этого не следует, что где-то внутри уже существует модель на поколение сильнее Astra. Это вполне возможно, но доказательств этого пока нет.
Обратная сторона дистилляции или феномен DeepSeek
Вы потратили миллиарды на вычисления, исследователей, RL, синтетические данные и eval infrastructure, а конкуренту для воспроизведения заметной части результата достаточно вытянуть несколько миллионов качественных ответов вашей модели через API. Ему не нужны ваши веса и необязательно понимать вашу архитектуру, он использует вашу модель как учителя, генерирует миллионы заданий, собирает ответы, фильтрует лучшие траектории ризонинга, обучает свою модель, потом использует вашу же модель как судью и повторяет цикл. Экономика получается перекошенная: вы платите за создание intelligence, конкурент платит за API-токены, чтобы этот intelligence перенести.
Ещё в 2025 году OpenAI заявляла, что обнаружила признаки использования её моделей для дистилляции. В феврале 2026 года Anthropic опубликовала намного более конкретные данные: по её утверждению, DeepSeek, Moonshot и MiniMax вели против Claude дистилляционные кампании промышленного масштаба, более 24 000 фродовых аккаунтов и более 16 миллионов exchanges, и извлекались не случайные ответы, а дорогие кластеры возможностей: coding, reasoning, tool use, agents, grading, computer use. В Twitter Anthropic написала почти теми же словами: “16 million exchanges with Claude, extracting its capabilities to train and improve their own models.” Термин knowledge extraction здесь точнее, чем model stealing, потому что копировать веса никто не обязан, достаточно скопировать полезную функцию.
Отсюда возникает неудобная конструкция: фронтиер лабы сами постоянно используют дистилляцию, потому что это лучший известный способ сделать дорогой intelligence дешёвым, и одновременно стараются не дать дистиллировать себя. На техническом уровне это не лицемерие, разница в том, кто владеет учителем и имеет ли право использовать его ответы для обучения конкурента, но с точки зрения самой технологии происходит одно и то же: сильная модель производит supervision, на котором становится сильнее другая модель. Поэтому API перестал быть просто интерфейсом к продукту и стал каналом утечки возможностей, и чем больше вы отдаёте наружу (сырые логиты, пути ризонинга, оценки судьи, миллионы unrestricted-запросов), тем дешевле конкуренту построить студента. Ограничения API, rate limits, скрытые chain-of-thought, мониторинг координированных аккаунтов и запреты на competitive model training в лицензиях получают вполне понятную экономическую причину. Clément Delangue, CEO Hugging Face, в этом году писал, что его не удивит сценарий, где фронтиер лабы начнут сильнее ограничивать API и направят дефицитные вычисления прежде всего на собственные продукты.
Что из этого следует
Мы привыкли читать названия GPT, Claude, Gemini, Llama как отдельные законченные сущности: компания обучила GPT-6, значит GPT-6 и есть её intelligence. Реальности это соответствует всё хуже, потому что лаборатория выглядит скорее как непрерывный конвейер интеллекта: огромные training runs > чекпойнты > reinforcement learning > синтетические данные > учителя > критики > верифайеры > дистилляция > tool scaffolding > test-time compute > production deployment, а название модели, которое видит пользователь, это одна точка на этом конвейере, выбранная по соображениям стоимости и риска.
Поэтому формулировка вопроса «какая сегодня самая умная модель» не очень удачная. Содержательные вопросы другие: какой максимум возможностей уже существует внутри лаборатории, какая его часть есть в research-чекпойнтах, какая уже скрыта в публичных весах и ждёт нормального scaffolding, какую часть удалось дёшево дистиллировать в production. И главный: насколько далеко реальный фронтиер ушёл вперёд от того, что видит человек, открывающий новый чат — лидерборд публичных моделей не является показателем возможностей AI.
Больше полезного контента в моем тг‑канале: t.me/airamongush
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.