Odyssey-3: мировая модель, которая учит роботов физике по видео

Попробуйте объяснить ребёнку, почему кружка, столкнутая со стола, разбивается. Вы вряд ли начнёте с закона всемирного тяготения. Ребёнок просто увидит сотни падающих предметов, и в его голове сам собой сложился образ: вещи падают, твёрдое о твёрдое бьётся, жидкость растекается. Физику он «впитал» из наблюдений, а не из учебника.
А теперь представьте, что так же можно научить нейросеть. Не показывать ей тысячи часов одной и той же задачи, а дать посмотреть огромное количество видео, чтобы она сама поняла, как устроен мир. А потом прикрутить к ней руки, колёса или пропеллеры и объяснить, что от неё хотят, буквально за несколько десятков часов данных.
Именно на это делает ставку компания Odyssey. 15 сентября 2026 года она рассказала про Odyssey-3, а 8 октября открыла для всех research preview. В этой статье мы разберём, что это за модель, как её обучали, откуда берутся рекордные цифры и где заканчиваются факты и начинается маркетинг.
▍ Что такое мировая модель
Большие языковые модели предсказывают следующее слово. Мировая модель предсказывает следующее состояние мира: берёт то, что было раньше, добавляет действие (шаг вперёд, поворот руля, удар по предмету) и выдаёт, как всё будет выглядеть дальше.
Odyssey описывает Odyssey-3 как обучаемую динамическую систему, которая предсказывает, как объекты движутся и взаимодействуют в пространстве и как со временем развиваются ситуации. Модель получила знания о физике, динамике и причинно-следственных связях из широкого набора визуальных наблюдений. Дальше эти знания можно использовать двумя способами: как симулятор окружения и как фундамент для обучения политик управления разными машинами.
Идея не с нуля. Ещё в 2025 году Odyssey показывала интерактивное видео, которое реагирует на действия в реальном времени. Тогда это было скорее про новую форму медиа. Теперь заявка серьёзнее: общий интеллект для физических и виртуальных систем.
▍ Кто за этим стоит
Основатели Odyssey, Оливер Кэмерон и Джефф Хоук, около десяти лет занимались беспилотными автомобилями. Логика у них понятная: машине, чтобы решить, что делать дальше, нужно предсказать, что будет вокруг. Компания основана в 2023 году с мыслью вынести эту идею далеко за пределы дорог.
Они же честно описывают проблему отрасли. Робототехника двигалась через всё более узкие системы, каждая под свою задачу и с огромным количеством данных именно под неё. Авторы называют это брутфорсом: не хватает общего понимания мира, и этот недостаток компенсируют горами демонстраций. Человек, по их аналогии, может в восемнадцать лет сесть за опасный станок и научиться им управлять, потому что до этого всю жизнь наблюдал, как предметы движутся, реагируют на силу и как опасны столкновения.
▍ Как устроена модель
Общая архитектура: авторегрессионный диффузионный трансформер. Разберём по частям.
Данные. Обучающая выборка состоит из трёх источников:
интернет-видео с размеченными по времени и проверенными по схеме событиями;
записи игрового процесса с синхронизированными нажатиями клавиш и движениями мыши;
симуляции взаимодействия твёрдых тел с подписями и метаданными.
Первое даёт широту, второе даёт связь между действием и последствием, третье даёт аккуратную физику, где можно точно знать, что и почему произошло.
Обучение. Сначала Odyssey строит многошаговый видео-диффузионный трансформер, в который можно подавать промпты и управляющие сигналы, меняющиеся во времени. Затем модель делают авторегрессионной с помощью teacher forcing и каузальных масок. Проще говоря, при обучении ей показывают настоящие предыдущие кадры и запрещают подглядывать в будущее, а она учится продолжать мир с учётом действий.
Дистилляция. Диффузионная модель обычно делает много шагов на каждый кадр, а для игры в реальном времени это слишком медленно. Поэтому Odyssey применила посттренинг, сочетающий distribution-matching и adversarial distillation, и получила облегчённую версию, которая работает за несколько шагов. Это «ученик», который повторяет «учителя», но быстрее. Именно такую версию можно потрогать в браузере.
Размеры. Моделей две: Odyssey-3 с разрешением 832×480 и Odyssey-3 Pro с 1280×720. В превью можно ходить по сгенерированному миру от первого или третьего лица, отдельно двигать камеру и в процессе генерации вбрасывать события, чтобы посмотреть, как мир отреагирует. Число параметров в тех материалах, что я читал, не раскрывается.
▍ Физика: рекорд с оговоркой
Главный козырь Odyssey-3 Pro — результат на бенчмарке Physics-IQ Verified. Его сделали Anates Labs и DeepMind. Модели дают видео реального физического эксперимента (жидкости, оптика, механика твёрдых тел, магнетизм, термодинамика), просят продолжить его и сравнивают с тем, что произошло на самом деле.
Вот что показали модели Odyssey (по данным из анонса):
Режим | Odyssey-3 (480p) | Odyssey-3 Pro (720p) |
|---|---|---|
Видео-в-видео, базовые промпты | 51.8 | — |
Видео-в-видео, улучшенные промпты | 61.6 | 63.4 |
Видео-в-видео, best-of-8 | 64.4 | 66.1 |
Картинка-в-видео, базовые промпты | 41.0 | — |
Картинка-в-видео, улучшенные промпты | 48.8 | 50.0 |
Картинка-в-видео, best-of-8 | 52.8 | 54.7 |
Звёздочка здесь важная: заголовочные 66.1 получены в режиме best-of-8, то есть из восьми попыток берётся лучшая. Обычные значения скромнее (63.4 у Pro с улучшенными промптами), хотя всё равно впечатляют. Для честного сравнения с другими моделями стоит смотреть на сопоставимые режимы.
Отдельно Odyssey подчёркивает компромисс между точностью и стоимостью генерации: по её расчётам, при тех же вычислениях можно получить больше симуляций. Стоимость они считают из допущения в один доллар за час работы GPU MI355X, так что это модельная оценка, а не прайс-лист.
▍ Миры, в которых хочется жить
Второй бенчмарк, WorldMark, измеряет следование управлению, визуальное качество и память о мире. Odyssey посчитала среднее по 13 метрикам на собственных запусках, используя подписи самого бенчмарка. Результат:
Категория | Odyssey-3 | Ближайший конкурент |
|---|---|---|
От первого лица, стилизованные | 77.2 (1 место) | LingBot-World, 77.0 |
От первого лица, реальные | 80.6 (3 место) | Lyra 2.0, 84.4 |
От третьего лица, реальные | 79.0 (1 место) | HY-World 1.5, 76.9 |
От третьего лица, стилизованные | 76.3 (1 место) | HY-World 1.5, 75.1 |
Обратите внимание: первое место в одной из категорий выиграно с разницей в 0,2 балла, а в «реальном» мире от первого лица модель только третья. Сама компания оговаривается, что эти метрики оценивают конкретные свойства сгенерированных миров, а для применения к физической системе нужно отдельно проверять поведение, важное именно для этой машины.
▍ От картинки к железу
Самое интересное начинается, когда мировую модель превращают в мозг для машин. Схема такая: основа остаётся замороженной, а к ней добавляют небольшой обучаемый компонент, который переводит внутренние представления модели в команды конкретного устройства. Для этого нужны пары «наблюдение, действие», и их нужно немного.
Роботы-манипуляторы. С десятками часов демонстраций модель выполняет задачи вроде «налей хлопья в миску» или «закрой коробку с винтами». Авторы отдельно отмечают поведение восстановления, которого не было в демонстрациях: робот переориентирует захват после промаха и достаёт предмет, упавший в неудобном положении. Это ровно то, что обычно требует демонстраций всех возможных провалов. Для проверки на разных телах и средах Odyssey сотрудничает с Poke & Wiggle.
Гуманоиды. Компания Flexion построила на Odyssey-3 политики управления гуманоидами. По словам авторов, они лучше обобщаются на изменения среды, чем протестированные VLA-базовые модели, и продолжают работать при смене освещения, на которой базовые падают. Какие именно базовые модели сравнивались, в анонсе не уточняется.
Автомобили. Политика, обученная на 20 часах симулированного вождения, при замороженной основе ездит в замкнутом контуре по улицам Индии, предсказывая точки маршрута впереди. Любопытная цифра: политики, обученные полностью в симуляции, проезжали между вмешательствами водителя-страхующего около 77% от дистанции политик, обученных на реальных записях.
Дроны. Политика навигации обучена на десятках часов симулированных полётов и показала стабильный полёт с облётом препятствий, но в симулированном помещении.
Игры. Политики на основе Odyssey-3 играли в GTA V. А ещё есть намёк на перенос: модель, обученная примерно на двух часах GTA, умела двигаться верхом на лошади в Red Dead Redemption 2 и ездить на мотоцикле в Sleeping Dogs без дообучения на этих играх.
Многокамерные данные. После всего 100 шагов обучения контрольная точка выдавала видео сразу с трёх фронтальных камер автомобиля.
Обратите внимание, сколько здесь «симуляции». Это не упрёк, а способ читать анонс: часть демонстраций показывает, что подход работает, но реальный мир с его шумом и редкими ситуациями остаётся главным экзаменом.
▍ Мир как тренажёр для других ИИ
Отдельная линия: если модель умеет генерировать окружения, в них можно запускать и обучать других агентов. В демонстрации агент получает цель на естественном языке и пытается её выполнить, наблюдая сгенерированный мир.
За этим стоит идея рекурсивного обучения, которую Odyssey развивает в проекте PROWL: агенты находят слабые места мировой модели, это помогает её улучшать, а надёжные симулированные миры, в свою очередь, обучают агентов. Чем лучше мир, тем сложнее опыт, чем сильнее агенты, тем более скрытые недостатки они находят. Рядом лежат Agora-2, где в одном мире одновременно действуют несколько людей или ИИ, и Starchild-1, который пытается выйти за рамки обучения только на визуальных наблюдениях.
Есть и безопасностный мотив. Авторы пишут, что такие миры позволяют изучать, как ведут себя всё более способные агенты, и находить опасное поведение до того, как оно проявится в физическом мире.
▍ Скептический взгляд
Немного трезвости, потому что анонс красивый.
Рекордные 66.1 получены в режиме best-of-8, а оценки по WorldMark Odyssey провела сама.
Черипикинг: мы видим удачные ролики, но не знаем, сколько было неудачных.
Физика видео не равна качеству управления. Physics-IQ проверяет, насколько хорошо модель продолжает эксперимент, а не как хорошо по ней ездит машина.
Многие демонстрации (автомобили, дроны) основаны на симуляторе, а «десятки часов данных» всё равно остаются немалым объёмом, хоть и меньшим, чем раньше.
Сторонний обзор отмечает, что публичных цен, лицензии и документации API на момент его выхода не было. Доступ для разработчиков физических систем, судя по сайту, пока по запросу.
Фразы вроде «самая физически точная мировая модель в мире» остаются фразами из соцсетей. Подтверждает их лишь конкретный бенчмарк.
В защиту авторов: они сами пишут, что мировые модели пока отстают от языковых по масштабу примерно на два порядка, и признают, что вопрос устойчивости результатов на разных роботах и средах остаётся открытым.
▍ Итоги
Odyssey-3 — это попытка сделать для физического мира то, что большие языковые модели сделали для текста: один предобученный фундамент, на который за небольшое число часов данных навешивается руль, манипулятор или пропеллер. Пока это смесь настоящих достижений и обещаний, которые ещё предстоит проверить в реальном мире.
Следить за этим очень интересно, а попробовать preview можно уже сегодня.
Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.