Green Challenge 2026: конкурс моделей Physical AI для антропоморфного робота «Грин»


Управление роботом по изображениям и текстовым инструкциям остаётся одной из наиболее актуальных задач современной робототехники. Модели класса Vision-Language-Action, или VLA, уже способны решать широкий спектр задач. Однако большинство заметных результатов получено на стандартных манипуляторах: это одна роботизированная рука на неподвижном основании, с шестью или семью степенями свободы и двупалым захватом.
Управление антропоморфным роботом требует решения задачи принципиально иного уровня сложности. Большое количество степеней подвижности, антропоморфные кисти, мобильная платформа, необходимость координировать движения всего тела и сохранять равновесие существенно усложняют разработку системы управления.
Sber Robotics запускает Green Challenge, соревнование в рамках AI Journey 2026. Участникам предстоит создать или дообучить модель управления «Грином», первым антропоморфным роботом Сбера. Модель должна решать задачи мобильной манипуляции в цифровом симуляторе.
Это комплексная задача в области Physical AI: от подготовки данных и мультимодального восприятия до планирования и согласованного управления движениями всего тела робота.



Что за задача?
Модель управляет роботом, получая на вход данные трёх типов:
RGB-изображения с трёх камер: одна расположена в голове робота, две другие закреплены на левом и правом запястьях. Разрешение каждого изображения составляет 448 × 448 пикселей.
Текстовую инструкцию: формулировку полной задачи сценария (task), а также описание текущей атомарной подзадачи (subtask).
Проприоцептивное состояние робота: положения суставов и ориентацию корпуса.
В качестве результата модель должна предсказать целевые положения суставов, то есть абсолютные значения joint positions. Эти команды исполняет Whole-Body Controller (WBC), координирующий движения всего тела робота.
Сценарии представляют собой цепочки взаимосвязанных действий. Например, роботу необходимо поднять нужную руку, дотянуться до полки, взять предмет, перенести его и вернуть руку в исходное положение.
Это не набор независимых навыков, а единая последовательность действий. Ошибка на раннем этапе может нарушить положение робота или предмета и каскадно повлиять на успешность всего эпизода.
Главный вызов: устойчивость к состояниям вне обучающего распределения
Первое естественное решение — собрать демонстрации работы робота и обучить на них модель методом клонирования поведения (behavior cloning). Однако именно здесь возникает главный вызов соревнования: устойчивость к состояниям, которые отличаются от состояний в обучающих данных. В машинном обучении такие состояния называют состояниями вне обучающего распределения, или out-of-distribution (OOD). Главная причина OOD состоит в расхождении между состояниями, записанными в демонстрациях, и состояниями, в которые робот попадает при автономном выполнении задачи.
К такому расхождению приводят несколько факторов:
Новые сочетания начальных положений робота и объекта, отсутствующие в обучающем наборе данных.
Накопление ошибок исполнения. Низкоуровневый контроллер движения всего тела может не довести робота до целевого положения. Из-за этого следующее наблюдение и фактическое состояние робота будут отличаться от ожидаемых моделью.
Неточные траектории, предсказанные VLA-политикой. Они могут привести робота в состояния, которых не было в обучающем наборе данных.
Недетерминированность расчёта динамики и контактных взаимодействий в симуляторе.
Ошибочные последующие действия, которые политика принимает уже из отклонившегося состояния.
При этом базовые условия задачи не меняются: модель робота, набор камер, форматы наблюдений и действий, а также поведение контроллера движения всего тела при проверке решения в симуляторе остаются одинаковыми.
Отсюда следует ключевое требование: модель должна не только воспроизводить демонстрации, но и корректировать действия по текущим наблюдениям, работать с состояниями вне обучающего распределения и восстанавливаться после отклонений.
На соревновании оценивается решение целиком: подготовку данных, согласование состояний и действий, временную синхронизацию, мультимодальное восприятие, устойчивость управления и скорость выполнения модели.
Что получает участник?
Мы предоставляем полный набор инструментов для работы: от модели робота и симулятора до базовой VLA-модели. Все компоненты открыты и могут использоваться повторно в исследовательских и прикладных проектах.

Симуляционная среда на основе NVIDIA Isaac Sim и Isaac Lab. В репозитории доступны готовые сцены, модель робота, объекты и интерфейс управления: GreenSim. Трёхмерные модели сцен опубликованы отдельно: GreenChallengeAssets.
Набор данных для дообучения. Он содержит записи траекторий: RGB-изображения, проприоцептивные данные и действия робота. Данные представлены в формате LeRobot v2.1: GreenChallengeData. Подробнее о его составе расскажем в разделе «Набор данных».
Базовая модель Green-VLA. Это модель на 1,3 млрд параметров с открытыми весами, а также примерами запуска, инференса и обучения: репозиторий GreenVLA. Веса модели доступны в GreenChallengeModel.
Базовая модель — это отправная точка, а не ограничение. Участники могут дообучать Green-VLA, использовать собственные данные, изменять архитектуру модели и экспериментировать с подходами к обучению.
Набор данных
Для обучения доступен набор данных в формате LeRobot v2.1. Каждый эпизод содержит RGB-изображения с трёх камер, проприоцептивное состояние робота и целевые действия.
Всего в наборе 24 055 эпизодов и 72 165 видеофрагментов, по одному с каждой камеры в эпизоде. Это 15,17 млн временных шагов, каждому из которых соответствуют изображения с трёх камер. Общая продолжительность траекторий составляет около 140,5 часа, без суммирования длительности параллельных видеопотоков.
По происхождению данные делятся на три группы:
Источник данных | Количество эпизодов | Продолжительность траекторий |
|---|---|---|
Скриптовые демонстрации | 9 144 | ≈99,5 часа |
Mimic — синтетическое расширение демонстраций | 13 766 | ≈38,2 часа |
Непосредственная телеоперация | 1 145 | ≈2,7 часа |
Всего | 24 055 | ≈140,5 часа |
Продолжительность рассчитана по количеству временных шагов при частоте 30 Гц; значения в строках округлены независимо. Источником данных для подсчёта этой статистики является описание опубликованного датасета GreenChallengeData.
Скриптовые демонстрации автоматически собраны с помощью скриптовых политик. Они составляют основную часть набора по длительности (около 71%), хотя по количеству эпизодов преобладают данные, собранные с помощью Mimic.
Телеоперационные демонстрации записаны при ручном управлении роботом. Mimic расширяет исходные демонстрации синтетически: полученные эпизоды выделены в отдельную группу, а не учитываются как новые записи ручного управления. Это позволяет нарастить объём обучающей выборки при ограниченном объёме телеоперации.
Такое сочетание источников даёт участникам возможность исследовать не только архитектуру VLA, но и состав обучающей выборки: сравнивать источники данных, менять их пропорции и оценивать, насколько синтетическое расширение помогает на конкурсных задачах.
Скриптовая политика
Скриптовая политика представляет собой параметризованный исполнитель манипуляционного навыка. Она использует текущее состояние сцены для построения целевых управляющих команд, а не воспроизводит заранее записанные траектории суставов. Такая политика не привязана к фиксированным координатам объекта в сцене.
Политика разбивает задачу на этапы: подход к объекту, позиционирование перед захватом, захват, перенос и размещение. Целевые позы кистей вычисляются динамически. Поэтому при рандомизации начального положения объектов изменяется не логика навыка, а конкретная целевая конфигурация движения.
Во время выполнения целевая поза уточняется с учётом актуального состояния робота и объекта. В результате одна и та же политика формирует семейство траекторий, согласованных с разными начальными положениями робота и объектов, а также с текущими кинематическими ограничениями и геометрией сцены.
Особенности набора данных
Скриптовые демонстрации обладают несколькими важными свойствами:
Начальные положения робота, объекта манипуляции и объектов окружения различаются между эпизодами.
При одинаковой логике манипуляционного навыка робот выполняет разные движения, поскольку целевые позы зависят от текущей конфигурации сцены и поведения низкоуровневого контроллера.
Данные содержат воспроизводимые успешные стратегии выполнения задач. Их можно автоматически собирать в большом объёме, без ручного управления каждым эпизодом.
Структура сценариев и результаты выполнения контролируются средствами бенчмарка. Это позволяет связывать траектории с условиями успеха и промежуточными подзадачами.
При этом скриптовые данные не следует считать исчерпывающим покрытием всех возможных состояний. Скриптовый эксперт преимущественно демонстрирует успешные или близкие к номинальным траектории. Поэтому в наборе ограниченно представлены состояния, возникающие после ошибок политики, нетипичных отклонений от траектории, неудачных попыток захвата и последующего восстановления.
Скриптовые демонстрации охватывают 15 задач в пяти сценах.
Это создаёт важную проблему при обучении VLA-моделей: даже небольшая ошибка в предсказанном действии может привести робота в состояние, которого не было в демонстрациях. Задача участника состоит не только в имитации действий эксперта, но и в повышении устойчивости модели к таким отклонениям и состояниям вне исходного распределения данных.
Участники могут обучать модель только на предоставленном наборе данных или дополнительно исследовать методы его расширения и собирать новые демонстрации. Самостоятельный сбор данных не является обязательным условием участия.
Траектории хранятся в формате Parquet, видео с камер закодировано в H.264, а метаданные представлены в JSON. Для каждого эпизода доступна разметка сегментов подзадач с текстовыми описаниями, а также маски валидности размерностей и статистики нормализации на уровне эпизодов. Это позволяет экспериментировать с мультимодальными моделями, не тратя время на построение и синхронизацию набора данных с нуля.
Ниже приведён минимальный пример чтения состояния и действий из одного эпизода:
import pyarrow.parquet as pq
import numpy as np
table = pq.read_table("dataset/data/chunk-000/episode_000000.parquet")
df = table.to_pandas()
state = np.array(df["observation.state"].tolist()) # Размерность: (N, 51)
action = np.array(df["action"].tolist()) # Размерность: (N, 52)
legs = state[:, 0:12] # Суставы ног
wrists = state[:, 25:29] # Суставы запястий
fingers = state[:, 29:41] # Суставы пальцевНабор данных и сцены мы готовили совместно с коллегами из Центра когнитивного моделирования Института ИИ МФТИ
Чем Green Challenge отличается от других бенчмарков?
Бенчмарки для гуманоидных роботов уже существуют, но проверяют разные стороны управления. HumanoidBench делает акцент на локомоции и манипуляции всем телом, EgoVLA — на действиях рук и кистей по визуальным наблюдениям, а HumanoidArena на задачах с обязательным участием ног и взаимодействием политики с низкоуровневым контроллером. BEHAVIOR Challenge, в свою очередь, проверяет длинные бытовые сценарии на колёсной платформе.
Для сравнения мы отдельно учитываем конструкцию робота, интерфейс управления и происхождение демонстраций. Это не рейтинг сложности: наличие двуногой платформы само по себе не означает, что в каждом задании требуется ходьба, а количество часов не отражает всего разнообразия задач.
Бенчмарк | Двуногий робот | Управление пальцами¹ | Whole-body управление | Автоматические демонстрации² | Телеоперация | Данные, ч |
|---|---|---|---|---|---|---|
HumanoidBench, 2024 | ✓ | ✓ | ✓ | — | — | Корпус не заявлен |
EgoVLA benchmark, 2025 | ✓ | ✓ | —³ | — | ✓ | ≈4,8 |
HumanoidArena, 2026 | ✓ | ✗¹ | ✓ | — | ✓ | 5,89 |
BEHAVIOR Challenge, 2026 | ✗ | ✗ | ✓⁴ | — | ✓ | 1 950 |
Green Challenge, 2026 | ✓ | ✓ | ✓⁵ | ✓ | ✓ | 140,5 |
✓ — подтверждено; ✗ — отсутствует в рассматриваемой конфигурации; — — не заявлено в базовом релизе. Сравнение по публичным материалам на 16 сентября 2026 года; сторонние корпуса предобучения не учитываются.
Под управлением пальцами понимаются несколько управляющих каналов, а не единственная команда открытия или закрытия кисти. В интерфейсе политики HumanoidArena кисти управляются бинарно; это не утверждение об отсутствии многопалой механики.
Учитываются готовые автоматически полученные демонстрации, а не возможность самостоятельно генерировать данные в симуляторе. Для Green Challenge объединены скриптовые политики и Mimic.
Опубликованный интерфейс EgoVLA управляет руками и кистями, не ногами.
В BEHAVIOR совместно управляются колёсная база, корпус и руки, без двуногого равновесия. Конструкция R1Pro.
В Green действия исполняются через WBC. Три текущих конкурсных сценария преимущественно проверяют манипуляции у рабочего места; обязательная локомоция этой галочкой не подразумевается.
Отличие Green Challenge — сочетание двуногой антропоморфной платформы, управления многопалыми кистями, исполнения через WBC и смешанного обучающего набора. Участник может исследовать не только архитектуру модели, но и то, как скриптовые данные, телеоперация и синтетическое расширение влияют на устойчивость управления.
При этом мы не претендуем на самый большой корпус: BEHAVIOR Challenge 2026 значительно превосходит Green по длительности демонстраций. Наш акцент — на согласовании визуального восприятия, действий кистей и управления телом в многоэтапной манипуляции.
Робот: что под капотом
В соревновании используется антропоморфный робот Сбера «Грин». В симуляторе его модель имеет 41 управляемую степень свободы.
Полное состояние робота, доступное модели, представлено вектором размерности 51. Он включает в себя:
положения 12 суставов ног;
положение корпуса, суставов обеих рук, шеи, запястий и пальцев;
ориентацию корпуса по крену и тангажу;
высоту таза;
линейную и угловую скорость корпуса.
Модель предсказывает вектор действия размерности 52. Он содержит в том числе служебный параметр episode_progress, который показывает прогресс текущего эпизода и принимает значения от 0 до 1.
Физика в симуляторе рассчитывается с частотой 250 Гц. Это от двух до четырёх раз больше количества физических шагов, чем в сопоставимых бенчмарках задач манипуляции.
Моделирование антропоморфного робота существенно сложнее, чем управление стандартным манипулятором. Необходимо учитывать большое количество степеней подвижности, контактные взаимодействия и работу контроллера движения всего тела. Он координирует движения обеих рук, корпуса и мобильной платформы.
Поэтому Green Challenge не сводится к упрощённой задаче захвата и переноса предмета. Участникам предстоит работать с симуляцией, в которой учитываются динамика человекоподобного робота, контакты с объектами и согласованное управление всем телом.
Baseline: модель Green-VLA
Отправной точкой для участников служит компактная конкурсная версия базовой модели Green-VLA размером около 1,3 млрд параметров. Это полноценная модель класса Vision-Language-Action. Она получает на вход изображения с трёх камер, состояние робота и текстовую инструкцию, после чего формирует управляющую траекторию для контроллера движения всего тела робота, WBC.
В основе модели лежат мультимодальный бэкбон Qwen3.5-0.8B и отдельный модуль предсказания действий, action expert. Действия генерируются методом flow matching. За 10 шагов интегрирования модель строит траекторию из 50 точек. При частоте обучающих данных 30 Гц это соответствует примерно 1,67 секунды движения.

Сервер исполняет прогноз в замкнутом контуре, обновляя его по новым наблюдениям. В базовой конфигурации интервал обновления составляет 80 мс симуляционного времени, а шаг управления — 4 мс. Фактическая скорость работы зависит от оборудования и реализации инференса.
Инференс запускается одной командой: ./run_inference.sh --checkpoint "<путь_к_чекпоинту>".
Скрипт проверяет структуру чекпоинта, собирает Docker-образ и запускает сервер политики. Симулятор подключается к серверу по WebSocket, а сообщения сериализуются в формате MessagePack. Для проверки доступности сервера предусмотрен HTTP-эндпоинт состояния.
Чекпоинт должен содержать веса модели и статистику нормализации:
checkpoint/
├── pretrained_model/
│ ├── config.json
│ └── model.safetensors
└── norm_stats/
└── <asset_id>/
└── norm_stats.jsonУчастникам предоставляется готовый Docker-образ. В него уже включены Qwen3.5-0.8B, конфигурация модели, процессор изображений и опубликованный чекпоинт базовой модели. После получения образа запуск и инференс выполняются полностью офлайн. Доступ к интернету требуется только при самостоятельной сборке образа.
Код, инструкции и примеры запуска опубликованы в репозитории aij_contest_inference. Контракт между моделью, сервером политики и симулятором описан в документации по инференсу.
Три соревновательных сценария
Валидационные сценарии охватывают три домена: «Сбер Шоп», даркстор и кухню. В конкурсный бенчмарк входят три сценария:



sber_shop.e1.a2 (70 секунд). Роботу необходимо правой рукой поднять крышку коробки Sber Ring, отложить её в сторону, сдвинуть коробку к посетителю, а затем вернуть её на исходное место. Сценарий состоит из пяти взаимосвязанных подзадач. Ошибка на любом этапе может привести к провалу всего эпизода.
darkstore.e1.a2 (35 секунд). Робот должен взять правой рукой красную банку газировки и поставить её на свободное место рядом с другими такими же банками. Успешным считается только выполнение, после которого все банки остаются в вертикальном положении.
dry_kitchen.e3.a2 (52 секунды). Роботу нужно поднять правую руку, взять сахарницу с полки, поставить её на поднос и убрать руку.
Помимо конкурсных сценариев, участникам доступен расширенный набор сцен для обучения и отладки. В него входят как простые подзадачи, например «взять чашку», так и многошаговые сценарии, такие как «собрать брендированный набор» и «перенести корзину».
Метрика: не «повтори демонстрацию», а «устойчиво достигни цели»
Главный критерий качества решения в соревновании состоит не в точном воспроизведении демонстраций. Модель должна устойчиво достигать цели в условиях ограниченного покрытия обучающих данных и вариативности исполнения управляющих команд.
Метрика оценивает выполнение на уровне отдельных подзадач. Для каждой успешно завершённой подзадачи рассчитывается скорость выполнения:
где обозначает фактическое время выполнения подзадачи, а
является ограничением времени для сценария.
Если подзадача не завершена, её вклад в итоговый результат равен нулю. Итоговый балл равен сумме значений для всех успешно завершённых подзадач.
Таким образом, баллы начисляются только за подзадачи, которые робот фактически довёл до конца. При прочих равных более быстрое выполнение приносит больше баллов.
С чего начать
Мы постарались снизить порог входа, чтобы участники могли быстро запустить модель и получить первые результаты.
Отобранные эпизоды работы базовой VLA-модели на валидационных сценариях (модель выполняет отдельные подзадачи, однако не гарантирует успешное завершение всего эпизода):




Что нужно, чтобы начать:
Клонируйте репозиторий симулятора, затем скачайте ассеты и набор данных с Hugging Face.
Реализуйте интерфейс своей модели или используйте базовую модель Green-VLA.
Запустите локальный скрипт оценки. Он проверит модель на валидационных сценах и выведет промежуточные метрики.
Упакуйте решение в Docker-образ и загрузите его на платформу конкурса.
Подробные инструкции доступны в документации репозитория симулятора и на странице конкурса.
Приём решений открыт с 7 сентября по 20 октября 2026 года.
Заключение
Green Challenge даёт возможность поработать с полным стеком Physical AI для антропоморфного робота «Грин». Участникам доступны полноценный симулятор, открытый набор данных, базовая VLA-модель с открытыми весами и бенчмарк, который оценивает устойчивость и скорость выполнения задач.
Если вы хотите проверить, насколько ваша модель способна управлять антропоморфным роботом при ограниченном объёме обучающих данных, присоединяйтесь к соревнованию. Начать можно уже сегодня, используя готовую базовую модель Green-VLA.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.