Мы ждали Терминатора, а получили Алису на ножках. Что внутри китайских роботов

Типичный ролик из недалёкого будущего: Гуманоид уверенно шагает рядом с полицейскими. Робособака обследует территорию. Робот-официант объезжает посетителя с таким выражением «лица», что чаевых сегодня не будет.
Хочется верить, что внутри каждого сидит единый искусственный разум: видит мир, понимает происходящее, принимает решения и управляет телом. Но это не совсем так.
Например, внутри AgiBot X2 Ultra работают три самостоятельных компьютера: для управления движением, взаимодействия с человеком и пользовательских вычислений. А ниже находится ещё и электроника приводов и датчиков. Это не один электронный мозг. Скорее небольшая организация, которой выдали общее тело. (Agibot)
Один отдел отвечает за то, чтобы робот не упал. Другой — за обработку изображений. Третий — за вежливое «Здравствуйте!». И желательно, чтобы совещание третьего отдела не мешало первым двум.
Разберёмся, зачем роботу столько компьютеров, что такое камера глубины, что на самом деле делает SLAM и сколько Робокопа содержится в китайском роботе-полицейском.
Промышленные манипуляторы пока оставим. Сегодня — машины, которые ходят и ездят среди нас.

Один корпус, три компьютера. Кто здесь главный?
Начнём с AgiBot X2 Ultra. В рассматриваемой комплектации у него два Rockchip — RK3588 и RK3588S — и NVIDIA Jetson Orin NX. Задачи распределены между узлами PC1, PC2 и PC3. Нумерация выглядит как названия компьютеров в бухгалтерии, но назначения у них разные. (Agibot)
PC1 отвечает за штатное управление движением. Это не место, куда стоит поставить любимый экспериментальный сервис, потому что «тут процессор почти свободен». AgiBot прямо запрещает использовать этот узел как среду для пользовательских приложений. В робототехнике падение production действительно означает падение на пол.
PC2 — вычислитель разработчика на Orin NX. Здесь можно размещать собственные приложения и обработку данных. Например, передняя стереокамера X2 связана именно с этим вычислителем; её данные доступны для задач стереозрения, восприятия препятствий и визуальной одометрии.
PC3 занимается взаимодействием. В частности, файлы для штатного воспроизведения аудио и видео должны находиться на нём, а не на PC2. Положить ролик «в робота» недостаточно. Нужно ещё положить его в правильного робота внутри робота.
Такое разделение решает важную инженерную задачу: тяжёлое приложение не должно бесконтрольно отбирать ресурсы у управления телом. Но три компьютера — не три независимые вселенные. У них остаются общие каналы обмена, питание и физический корпус.

У Unitree встречается похожая идея. G1 имеет основной восьмиядерный CPU, а дополнительные вычислители, включая Orin или Thor, зависят от комплектации EDU. У H1 уже явно разделены Intel Core i5 для функций платформы и Intel Core i7 для пользовательской разработки. (Unitree)
Да, внутри китайского гуманоида вполне может работать Intel. Робототехника — не конкурс на чистоту родословной процессора.
У Deep Robotics хорошо видна разница между готовой и исследовательской машиной. В открытом проекте на Lite3 Venture разработчики добавляют Jetson AGX Orin, камеры и лидар для запуска FAST-LIVO2. При этом у рассматриваемых версий Lite3 Pro и LiDAR уже есть Orin NX, который можно использовать для дополнительных вычислений. (GitHub)
Поэтому фотография робособаки с мощным компьютером на спине ещё не означает, что именно так она приехала с завода. Иногда это собака. Иногда — собака, на которой кто-то едет.
Rockchip или Jetson? Вопрос поставлен не совсем правильно

Rockchip RK3588 — полноценная система на кристалле: четыре ядра Cortex-A76, четыре Cortex-A55, графика и нейроускоритель с заявленной производительностью до 6 TOPS. Это не просто «процессор для экранчика». (Rock Chips)
На таком вычислителе можно проектировать интерфейс, работу с периферией, сетевые службы и алгоритмы обработки данных. Хватит ли ресурсов для конкретной навигации или модели зрения — вопрос нагрузки, реализации и допустимой задержки, а не наличия заветной наклейки.
Jetson Orin — уже семейство модулей: Nano, NX, AGX. Их сильная сторона — сочетание CPU, GPU, памяти и программной экосистемы NVIDIA для нейросетевых вычислений и компьютерного зрения. JetPack и Isaac ROS здесь не менее важны, чем характеристики самого чипа. (NVIDIA)
Но цифра TOPS — не коэффициент интеллекта.
Умножить её на число камер и получить вероятность того, что робот принесёт кофе, нельзя. Производительность зависит от конкретной модели, точности вычислений, использования ускорителей, пропускной способности памяти и режима питания. Даже внутри семейства Orin различаются ресурсы и условия достижения пиковых значений. (NVIDIA)
Для инженера правильный вопрос звучит примерно так:
Успевает ли наша система обработать нужные данные, принять решение и выдать команду в отведённое время?
А не так:
Сколько искусственного интеллекта помещается в этого человека?
Причём колёсному доставщику и гуманоиду могут требоваться совершенно разные вычислительные бюджеты. Alpha Speedybot предназначен для доставки небольших вещей по отелю и сопровождения гостей. Pudu BellaBot — для перевозки блюд. Это определённые рабочие сценарии, а не обязанность самостоятельно разобраться со всем человеческим бытом. (Alpha Robotics)
Чтобы привезти тапочки в номер, не обязательно обладать общим интеллектом. Иногда достаточно точно знать, где номер и где тапочки.
Глаза на лице могут оказаться не основными глазами
У робота нет одного универсального органа зрения. Есть несколько систем, каждая из которых отвечает на свой вопрос.
Обычная RGB-камера даёт цветное изображение. Для нас это уже понятная картинка. Для программы — массив значений, из которого ещё предстоит извлечь людей, двери, предметы и другие полезные сущности.
RGB-D-камера добавляет глубину: кроме цвета система получает оценки расстояний. А стереокамера использует два разнесённых изображения, чтобы вычислять расстояния по различиям между ними.
Здесь часто возникает путаница: RGB-D и стерео — не противоположности. Первое описывает выдаваемые данные, второе — способ их получения.
Например, Orbbec Gemini 335 является RGB-D-устройством на основе активного и пассивного стереозрения. Внутри у неё есть собственный процессор глубины MX6800: часть работы выполняется ещё до передачи данных основному компьютеру. Получается, в нашем роботе с несколькими компьютерами обнаружился ещё один специализированный вычислитель. (Orbbec)

Для масштаба посмотрим на набор сенсоров X2 Ultra в аппаратной конфигурации, рассмотренной в нашем исследовании:
Сенсор | Что получает робот |
|---|---|
RoboSense E1R в груди | Трёхмерные измерения окружающей геометрии |
Orbbec Gemini 335 | Цветное изображение и карту глубины |
Передняя стереопара SenYun | Два изображения для стереовосприятия |
Передняя камера взаимодействия | Изображение для задач общения и визуального распознавания |
Задняя RGB-камера | Обзор пространства позади корпуса |
Дополнительно установлены инерциальные датчики в груди и тазовой части. Они помогают оценивать движение самого тела. Конкретный набор зависит от аппаратной ревизии, но принцип хорошо виден: у каждого источника данных своя работа. (Agibot)
Поэтому вопрос «сколько у робота камер?» неожиданно требует уточнений. Считаем модули? Физические матрицы? Цветные потоки? Стереопару за одну камеру или за две?
Робот ещё ничего не сделал, а техническое задание уже требует редакции.
Лидар: геометрия без понимания происходящего
Лидар измеряет расстояния и позволяет получить набор точек окружающего пространства. Но облако точек само по себе не объясняет, что перед нами: стул, человек или очень странный торшер. Геометрию ещё нужно превратить в пригодное для задачи описание мира. Именно поэтому лидарная одометрия и полноценная навигация существуют как отдельные программные задачи. (GitHub)
Двумерный лидар сканирует плоскость. Для карты этажа это удобно, но вся трёхмерная жизнь в одну плоскость не помещается. Представим стол: скан на небольшой высоте может увидеть ножки, но не описать нависающую столешницу.
Поэтому у BellaBot не только лидар, но и три RGB-D-камеры — в том числе для обнаружения низких и нависающих препятствий. Умилительное кошачье лицо не отменяет необходимости внимательно смотреть под ноги. Даже если ног нет. (Pudu Robotics)
У 3D-лидаров тоже разная геометрия обзора. E1R на X2 смотрит в широкий передний сектор. Livox Mid-360 даёт круговой горизонтальный обзор. На актуальной странице Unitree Go2 указан собственный лидар L2 с обзором 360° × 96°. Название «3D-лидар» ещё не говорит, какую часть пространства реально видит машина.
У крупной робособаки Unitree B2 набор может включать один 3D-лидар, две камеры глубины и две оптические камеры. Больше сенсоров означает больше способов наблюдать мир — и больше данных, которые нужно правильно согласовать.
SLAM: «Я здесь уже был. Кажется»
Представьте, что вас впервые пустили в большой торговый центр, не дали план и попросили одновременно нарисовать карту и отмечать на ней своё положение.
Примерно этим занимается SLAM — одновременная локализация и построение карты.
Робот сопоставляет последовательные наблюдения и оценивает, как переместился. Из этих наблюдений формируется карта, а карта помогает уточнять положение. Две задачи поддерживают друг друга: чтобы строить карту, нужно знать, откуда смотрел; чтобы понять, откуда смотришь, полезно иметь карту. (MathWorks)
Оценки неизбежно содержат ошибки. Поэтому важен, например, механизм замыкания петли: система узнаёт ранее посещённое место и использует это соответствие для корректировки накопленной карты и траектории. Такие функции есть, в частности, в SLAM Toolbox. (GitHub)
Однако SLAM — не волшебная кнопка «робот теперь автономный».
Удобно разделять три вопроса: где я нахожусь, куда мне нужно попасть и как безопасно туда двигаться. Карта и локализация помогают с первым. Планировщики и контроллеры навигации — со следующими. Именно такую отдельную работу выполняет, например, Nav2. (GitHub)
Робот вполне может точно знать, где находится, и при этом не иметь возможности выполнить ваше поручение. В этом смысле он уже немного похож на человека в понедельник.
Вариант первый: плоская карта для колёсной жизни
Двумерный лазерный SLAM строит карту, удобную для движения по этажу. После первоначального картографирования робот может работать по сохранённой карте, локализуясь на ней. SLAM Toolbox поддерживает оба сценария. (GitHub)
При этом объёмные препятствия можно учитывать отдельным слоем. Использование RGB-D-камер не обязывает всю систему навигации хранить мир как детальную трёхмерную сцену: для многих решений достаточно карты проходимости и локальных наблюдений препятствий. (GitHub)
Вариант второй: лидар плюс чувство собственного тела
Для подвижной платформы полезно объединять лидар и IMU — инерциальный измерительный блок. Лидар наблюдает окружающую геометрию, IMU даёт измерения ускорений и вращения.
Пример такого подхода — FAST-LIO2. Это лидарно-инерциальная одометрия с построением карты. Но наличие FAST-LIO2 ещё не означает, что к нему автоматически прилагаются поиск маршрута, управление дверями и вежливое расхождение с посетителями. (GitHub)
Вариант третий: ориентироваться по изображениям
Визуальный SLAM использует камеры. ORB-SLAM3 поддерживает монокулярные, стереоскопические, RGB-D- и визуально-инерциальные конфигурации. Поэтому за одинаковой надписью «Visual SLAM» могут стоять довольно разные системы. (GitHub)
Вариант четвёртый: собрать все показания вместе
В комбинированной системе объединяются камеры, лидар и IMU. Так работает FAST-LIVO2, который Deep Robotics показывает на исследовательской конфигурации Lite3.
Но недостаточно прикрутить три датчика и написать «sensor fusion». Их измерения нужно согласовать по времени и взаимному положению. В проекте Deep Robotics отдельно предусмотрены варианты с аппаратной и программной синхронизацией. (GitHub)
Иначе один сенсор сообщает, что робот ещё смотрит вперёд, второй — что уже повернул, а алгоритму предлагают творчески примирить эти версии событий.
Небольшая, но важная оговорка: перечисленные открытые алгоритмы — примеры подходов. Это не утверждение, что именно они установлены в заводской прошивке каждого робота с соответствующим датчиком.
Внутри действительно локалка. Со всеми вытекающими
Компьютерам нужно обмениваться состояниями, изображениями, облаками точек и командами.
У X2 доступны гигабитные Ethernet-интерфейсы для работы с Orin NX и Rockchip. У Unitree есть интерфейсы обмена, совместимые с ROS2 и DDS. Это уже вполне узнаваемый сетевой мир — только вместо принтера на другом конце может оказаться система управления телом. (Agibot)
При этом соединения внутри машины неоднородны. Камера может быть подключена по USB, а управление суставами — использовать специализированный интерфейс. Например, у X2 есть отдельный слой управления суставами через EtherCAT. Не стоит представлять весь робот как один большой USB-хаб или считать, что все его устройства доступны любому бортовому компьютеру одинаковым способом. (Orbbec)
И ещё: камерные данные очень быстро съедают пропускную способность.
Посчитаем условный несжатый RGB-поток: 1920 × 1080 пикселей, три байта на пиксель, 30 кадров в секунду.
1920 × 1080 × 3 × 30 = 186,6 МБ/с, или примерно 1,49 Гбит/с.
Одна такая камера уже не помещается в гигабитный канал — даже без служебных накладных расходов.
Это не фактический режим конкретного X2, а простой расчёт. Он объясняет, почему идея «давайте передадим все исходные изображения на соседний компьютер» нуждается в обсуждении до реализации.
Приходится выбирать разрешение, частоту, формат, сжатие и место обработки. Для интерфейса оператора может быть достаточно сжатого изображения. Алгоритму глубины могут требоваться совсем другие данные.
Сам факт, что пакет когда-нибудь доехал, тоже не гарантирует его полезности. Для управления важны своевременность и предсказуемость обмена. В проекте Deep Robotics, например, при отсутствии аппаратной синхронизации требуется специальная коррекция времени сенсоров: без неё работа SLAM нарушается. (GitHub)
В обычной распределённой системе несогласованность данных — проблема. В распределённой системе с ногами она ещё и может перемещаться по комнате.
Как мы искали глаза робота и нашли отсутствующий топик
В нашем разборе X2 Ultra вместе с Codex возникла очень земная ситуация: камеры есть, интерфейс просмотра есть, картинки нет.
Приложение подписывалось на:
/camera/head/image_raw
Звучит логично. Даже красиво.
Проблема в том, что такого топика у рассматриваемой системы не было. Это оказалось условное имя, оставшееся в проекте до подключения настоящего робота. Реальные каналы назывались иначе и отдельно представляли стереопару, RGB-D-модуль и заднюю камеру.
Есть и следующая ступень посвящения в ROS2: топик уже виден, но сообщения всё равно не приходят.
Одна из возможных причин — несовместимые настройки QoS, то есть условий доставки. Например, издатель предлагает BEST_EFFORT, а подписчик требует RELIABLE. Такая пара не устанавливает совместимую передачу.
Наконец, обнаружилось принципиальное ограничение: передняя камера взаимодействия физически существовала, но её публичный интерфейс отсутствовал в рассмотренной версии AimDK 1.0.0 — его убрали начиная с 0.8.1.
Из этого следует правило, которое хочется напечатать на коробке каждого робота:
Сенсор установлен. Штатная система его использует. Разработчик может получить его данные. Это три разных утверждения.
Глаза есть. Доступа может не быть. Почти корпоративная информационная безопасность.
А где во всей этой конструкции искусственный интеллект?
Словом «ИИ» удобно назвать сразу всё, но инженерно это разные уровни.
Обученная политика движения может получать состояние тела и формировать управляющие воздействия. Например, Unitree использует обучение в симуляции для получения двигательных навыков Go2. Это не разговорная модель, которая рассуждает о следующем шаге красивыми предложениями. (Unitree)
Ниже работают контроллеры приводов. На низком уровне разработчик Lite3 имеет дело с положениями и скоростями суставов, коэффициентами регуляторов и моментами — а не с репликой «будь осторожнее». (GitHub)
Языковой модели можно поручить другой уровень: превратить запрос человека в понятное системе задание.
Например, для фразы «проводи гостя к переговорной» разумная архитектура выглядела бы так: определить нужную переговорную, найти соответствующую точку на карте, проверить возможность выполнения, запустить навигационный навык и контролировать результат.
Это пример проектирования, а не универсальная штатная функция китайских роботов.
Главное здесь — не позволить убедительному ответу подменить реальное действие. Фраза «Конечно, я принесу вам кофе» не создаёт навыков захвата чашки, переноски жидкости и безопасной передачи человеку.
Прочитать рецепт и приготовить борщ — разные API.
Поэтому задача интегратора — не просто подключить разговорный ИИ. Нужно связать его с конечным набором проверенных действий и предусмотреть, что произойдёт, когда выполнить их нельзя.
Роботы-полицейские: форма установлена, Робокоп ещё нет
Теперь о самых эффектных персонажах.
Гуманоид рядом с полицейскими, уверенная походка, поворот головы — и воображение само достраивает остальное. Сейчас он распознает преступление, оценит обстановку и решит проблему.
Но поворот головы не доказывает понимания ситуации, а ходьба рядом с сотрудником — автономной полицейской работы.
Кадры с EngineAI T800 в сопровождении полиции в Шэньчжэне действительно публиковались; CCTV описывало его участие как этап тестирования и демонстрации. Сам по себе такой выход не подтверждает способность самостоятельно выполнять полицейское вмешательство.
Есть и более конкретные прикладные сценарии. С 6 марта 2026 года робот-регулировщик в одном из районов Шэньчжэня работает на перекрёстке: выполняет жесты синхронно со светофорами, распознаёт отдельные ситуации вроде отсутствия шлема и подаёт предупреждения. Это определённая последовательность «обнаружить — предупредить», а не универсальный электронный сотрудник полиции. (wicinternet.org)
Разница огромная. Одно дело — пройти маршрут, передать видео, показать жест или воспроизвести предупреждение. Другое — разобраться в конфликте между людьми, выбрать допустимое действие и безопасно выполнить его в непредсказуемой обстановке.
Это уже целая цепочка задач восприятия, принятия решений и физического взаимодействия. Навык уверенной ходьбы сам по себе эту цепочку не создаёт.
Жилет с надписью POLICE — аксессуар, а не пакет навыков. Команды apt install участковый пока нет.
При этом впадать в обратную крайность и считать такие машины безобидными игрушками тоже неправильно. Даже сравнительно компактный G1 весит около 35 килограммов и имеет мощные приводы; производитель отдельно предупреждает о безопасной дистанции. Ограниченная самостоятельность не отменяет механической опасности. (Unitree)
Иными словами, ждать от робота поведения опытного человека преждевременно. Проверять его возможности толчком — тоже плохая исследовательская методика.
Но они же уже выступают на олимпиаде!
Да. World Humanoid Robot Games 2026 прошли в Пекине 22–26 августа, объединив спортивные и прикладные испытания. Это полезный способ проверять конкретные способности машин в условиях соревнования, а не только на монтажном столе рекламного ролика. (RoboCup)
Результаты действительно впечатляют: по сообщению Reuters, Tiangong Ultra завершил финальный забег на 100 метров за 8,64 секунды. После такого аргумент «от робота всегда можно просто убежать» лучше не использовать даже в шутку. (Reuters)
Но спортивный результат отвечает на конкретный вопрос.
Быстро пробежать дистанцию — не то же самое, что найти нужного посетителя в незнакомом здании, поговорить с ним, обойти внезапное препятствие и безопасно передать предмет.
В первом случае проверяется определённый двигательный навык. Во втором требуется согласованная работа восприятия, диалога, навигации, манипуляции и обработки исключений.
Медаль за стометровку не является сертификатом бариста.
Это не обесценивание соревнований. Наоборот: полезно понимать, какой именно технологический барьер удалось преодолеть, а какой ещё остаётся.
Самая впечатляющая функция — нормально закончить смену
Когда смотришь на робота как на инженерную систему, критерии постепенно меняются.
Сначала хочется узнать число степеней свободы, модель GPU и умеет ли он делать сальто. Потом — сколько раз за рабочий день потребуется вмешательство человека.
Для практического проекта я считаю именно это: сколько заданий завершено, сколько раз машина остановилась из-за нештатной ситуации, смогла ли восстановить работу и вернулась ли к задаче после зарядки.
Робот-официант, который регулярно довозит заказы, может быть полезнее куда более эффектной машины, для которой каждое новое поручение превращается в отдельную разработку. Это не соревнование внешности. Это разные уровни готовности конкретной функции.
Современный китайский робот — не один всесильный электронный мозг. Это вычислители, сенсоры, приводы, алгоритмы и интерфейсы, которые нужно заставить работать вместе.
И именно здесь находится большая часть интересной инженерии. Не в том, чтобы добавить ещё одну камеру или ещё больше TOPS, а в том, чтобы вся система предсказуемо выполнила работу.
Киношный Терминатор обещал: «Я вернусь».
Для настоящего робота это тоже отличное требование. Вернуться на маршрут после зарядки. Самостоятельно. Без звонка инженеру.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.