The Daily Newsstand · Free, Always
Saturday, October 10, 2026

Odyssey-3: мировая модель, которая учит роботов физике по видео

Translate

Попробуйте объяснить ребёнку, почему кружка, столкнутая со стола, разбивается. Вы вряд ли начнёте с закона всемирного тяготения. Ребёнок просто увидит сотни падающих предметов, и в его голове сам собой сложился образ: вещи падают, твёрдое о твёрдое бьётся, жидкость растекается. Физику он «впитал» из наблюдений, а не из учебника.

А теперь представьте, что так же можно научить нейросеть. Не показывать ей тысячи часов одной и той же задачи, а дать посмотреть огромное количество видео, чтобы она сама поняла, как устроен мир. А потом прикрутить к ней руки, колёса или пропеллеры и объяснить, что от неё хотят, буквально за несколько десятков часов данных.

Именно на это делает ставку компания Odyssey. 15 сентября 2026 года она рассказала про Odyssey-3, а 8 октября открыла для всех research preview. В этой статье мы разберём, что это за модель, как её обучали, откуда берутся рекордные цифры и где заканчиваются факты и начинается маркетинг.

▍ Что такое мировая модель

Большие языковые модели предсказывают следующее слово. Мировая модель предсказывает следующее состояние мира: берёт то, что было раньше, добавляет действие (шаг вперёд, поворот руля, удар по предмету) и выдаёт, как всё будет выглядеть дальше.

Odyssey описывает Odyssey-3 как обучаемую динамическую систему, которая предсказывает, как объекты движутся и взаимодействуют в пространстве и как со временем развиваются ситуации. Модель получила знания о физике, динамике и причинно-следственных связях из широкого набора визуальных наблюдений. Дальше эти знания можно использовать двумя способами: как симулятор окружения и как фундамент для обучения политик управления разными машинами.

Идея не с нуля. Ещё в 2025 году Odyssey показывала интерактивное видео, которое реагирует на действия в реальном времени. Тогда это было скорее про новую форму медиа. Теперь заявка серьёзнее: общий интеллект для физических и виртуальных систем.

▍ Кто за этим стоит

Основатели Odyssey, Оливер Кэмерон и Джефф Хоук, около десяти лет занимались беспилотными автомобилями. Логика у них понятная: машине, чтобы решить, что делать дальше, нужно предсказать, что будет вокруг. Компания основана в 2023 году с мыслью вынести эту идею далеко за пределы дорог.

Они же честно описывают проблему отрасли. Робототехника двигалась через всё более узкие системы, каждая под свою задачу и с огромным количеством данных именно под неё. Авторы называют это брутфорсом: не хватает общего понимания мира, и этот недостаток компенсируют горами демонстраций. Человек, по их аналогии, может в восемнадцать лет сесть за опасный станок и научиться им управлять, потому что до этого всю жизнь наблюдал, как предметы движутся, реагируют на силу и как опасны столкновения.

▍ Как устроена модель

Общая архитектура: авторегрессионный диффузионный трансформер. Разберём по частям.

Данные. Обучающая выборка состоит из трёх источников:

  • интернет-видео с размеченными по времени и проверенными по схеме событиями;

  • записи игрового процесса с синхронизированными нажатиями клавиш и движениями мыши;

  • симуляции взаимодействия твёрдых тел с подписями и метаданными.

Первое даёт широту, второе даёт связь между действием и последствием, третье даёт аккуратную физику, где можно точно знать, что и почему произошло.

Обучение. Сначала Odyssey строит многошаговый видео-диффузионный трансформер, в который можно подавать промпты и управляющие сигналы, меняющиеся во времени. Затем модель делают авторегрессионной с помощью teacher forcing и каузальных масок. Проще говоря, при обучении ей показывают настоящие предыдущие кадры и запрещают подглядывать в будущее, а она учится продолжать мир с учётом действий.

Дистилляция. Диффузионная модель обычно делает много шагов на каждый кадр, а для игры в реальном времени это слишком медленно. Поэтому Odyssey применила посттренинг, сочетающий distribution-matching и adversarial distillation, и получила облегчённую версию, которая работает за несколько шагов. Это «ученик», который повторяет «учителя», но быстрее. Именно такую версию можно потрогать в браузере.

Размеры. Моделей две: Odyssey-3 с разрешением 832×480 и Odyssey-3 Pro с 1280×720. В превью можно ходить по сгенерированному миру от первого или третьего лица, отдельно двигать камеру и в процессе генерации вбрасывать события, чтобы посмотреть, как мир отреагирует. Число параметров в тех материалах, что я читал, не раскрывается.

▍ Физика: рекорд с оговоркой

Главный козырь Odyssey-3 Pro — результат на бенчмарке Physics-IQ Verified. Его сделали Anates Labs и DeepMind. Модели дают видео реального физического эксперимента (жидкости, оптика, механика твёрдых тел, магнетизм, термодинамика), просят продолжить его и сравнивают с тем, что произошло на самом деле.

Вот что показали модели Odyssey (по данным из анонса):

Режим

Odyssey-3 (480p)

Odyssey-3 Pro (720p)

Видео-в-видео, базовые промпты

51.8

—

Видео-в-видео, улучшенные промпты

61.6

63.4

Видео-в-видео, best-of-8

64.4

66.1

Картинка-в-видео, базовые промпты

41.0

—

Картинка-в-видео, улучшенные промпты

48.8

50.0

Картинка-в-видео, best-of-8

52.8

54.7

Звёздочка здесь важная: заголовочные 66.1 получены в режиме best-of-8, то есть из восьми попыток берётся лучшая. Обычные значения скромнее (63.4 у Pro с улучшенными промптами), хотя всё равно впечатляют. Для честного сравнения с другими моделями стоит смотреть на сопоставимые режимы.

Отдельно Odyssey подчёркивает компромисс между точностью и стоимостью генерации: по её расчётам, при тех же вычислениях можно получить больше симуляций. Стоимость они считают из допущения в один доллар за час работы GPU MI355X, так что это модельная оценка, а не прайс-лист.

▍ Миры, в которых хочется жить

Второй бенчмарк, WorldMark, измеряет следование управлению, визуальное качество и память о мире. Odyssey посчитала среднее по 13 метрикам на собственных запусках, используя подписи самого бенчмарка. Результат:

Категория

Odyssey-3

Ближайший конкурент

От первого лица, стилизованные

77.2 (1 место)

LingBot-World, 77.0

От первого лица, реальные

80.6 (3 место)

Lyra 2.0, 84.4

От третьего лица, реальные

79.0 (1 место)

HY-World 1.5, 76.9

От третьего лица, стилизованные

76.3 (1 место)

HY-World 1.5, 75.1

Обратите внимание: первое место в одной из категорий выиграно с разницей в 0,2 балла, а в «реальном» мире от первого лица модель только третья. Сама компания оговаривается, что эти метрики оценивают конкретные свойства сгенерированных миров, а для применения к физической системе нужно отдельно проверять поведение, важное именно для этой машины.

▍ От картинки к железу

Самое интересное начинается, когда мировую модель превращают в мозг для машин. Схема такая: основа остаётся замороженной, а к ней добавляют небольшой обучаемый компонент, который переводит внутренние представления модели в команды конкретного устройства. Для этого нужны пары «наблюдение, действие», и их нужно немного.

Роботы-манипуляторы. С десятками часов демонстраций модель выполняет задачи вроде «налей хлопья в миску» или «закрой коробку с винтами». Авторы отдельно отмечают поведение восстановления, которого не было в демонстрациях: робот переориентирует захват после промаха и достаёт предмет, упавший в неудобном положении. Это ровно то, что обычно требует демонстраций всех возможных провалов. Для проверки на разных телах и средах Odyssey сотрудничает с Poke & Wiggle.

Гуманоиды. Компания Flexion построила на Odyssey-3 политики управления гуманоидами. По словам авторов, они лучше обобщаются на изменения среды, чем протестированные VLA-базовые модели, и продолжают работать при смене освещения, на которой базовые падают. Какие именно базовые модели сравнивались, в анонсе не уточняется.

Автомобили. Политика, обученная на 20 часах симулированного вождения, при замороженной основе ездит в замкнутом контуре по улицам Индии, предсказывая точки маршрута впереди. Любопытная цифра: политики, обученные полностью в симуляции, проезжали между вмешательствами водителя-страхующего около 77% от дистанции политик, обученных на реальных записях.

Дроны. Политика навигации обучена на десятках часов симулированных полётов и показала стабильный полёт с облётом препятствий, но в симулированном помещении.

Игры. Политики на основе Odyssey-3 играли в GTA V. А ещё есть намёк на перенос: модель, обученная примерно на двух часах GTA, умела двигаться верхом на лошади в Red Dead Redemption 2 и ездить на мотоцикле в Sleeping Dogs без дообучения на этих играх.

Многокамерные данные. После всего 100 шагов обучения контрольная точка выдавала видео сразу с трёх фронтальных камер автомобиля.

Обратите внимание, сколько здесь «симуляции». Это не упрёк, а способ читать анонс: часть демонстраций показывает, что подход работает, но реальный мир с его шумом и редкими ситуациями остаётся главным экзаменом.

▍ Мир как тренажёр для других ИИ

Отдельная линия: если модель умеет генерировать окружения, в них можно запускать и обучать других агентов. В демонстрации агент получает цель на естественном языке и пытается её выполнить, наблюдая сгенерированный мир.

За этим стоит идея рекурсивного обучения, которую Odyssey развивает в проекте PROWL: агенты находят слабые места мировой модели, это помогает её улучшать, а надёжные симулированные миры, в свою очередь, обучают агентов. Чем лучше мир, тем сложнее опыт, чем сильнее агенты, тем более скрытые недостатки они находят. Рядом лежат Agora-2, где в одном мире одновременно действуют несколько людей или ИИ, и Starchild-1, который пытается выйти за рамки обучения только на визуальных наблюдениях.

Есть и безопасностный мотив. Авторы пишут, что такие миры позволяют изучать, как ведут себя всё более способные агенты, и находить опасное поведение до того, как оно проявится в физическом мире.

▍ Скептический взгляд

Немного трезвости, потому что анонс красивый.

  • Рекордные 66.1 получены в режиме best-of-8, а оценки по WorldMark Odyssey провела сама.

  • Черипикинг: мы видим удачные ролики, но не знаем, сколько было неудачных.

  • Физика видео не равна качеству управления. Physics-IQ проверяет, насколько хорошо модель продолжает эксперимент, а не как хорошо по ней ездит машина.

  • Многие демонстрации (автомобили, дроны) основаны на симуляторе, а «десятки часов данных» всё равно остаются немалым объёмом, хоть и меньшим, чем раньше.

  • Сторонний обзор отмечает, что публичных цен, лицензии и документации API на момент его выхода не было. Доступ для разработчиков физических систем, судя по сайту, пока по запросу.

  • Фразы вроде «самая физически точная мировая модель в мире» остаются фразами из соцсетей. Подтверждает их лишь конкретный бенчмарк.

В защиту авторов: они сами пишут, что мировые модели пока отстают от языковых по масштабу примерно на два порядка, и признают, что вопрос устойчивости результатов на разных роботах и средах остаётся открытым.

▍ Итоги

Odyssey-3 — это попытка сделать для физического мира то, что большие языковые модели сделали для текста: один предобученный фундамент, на который за небольшое число часов данных навешивается руль, манипулятор или пропеллер. Пока это смесь настоящих достижений и обещаний, которые ещё предстоит проверить в реальном мире.

Следить за этим очень интересно, а попробовать preview можно уже сегодня.

Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.