CNN TürkGüller ve Günahlar'da Yüreklere Dokunan Buluşma: "Seni Bırakmayacağım, Serhat Abi"PunchNigeria High Commission refunds £50 to UK passport applicantsESPN DeportesLas predicciones del Gran Premio de España de Fórmula 1וואלהצה"ל פתח בירי ארטילרי במרחב ואדי הסלוקי בדרום לבנוןInquirer EntertainmentLady Gaga welcomes first child with fiance — reportsInquirerRare leucistic Philippine duck spotted in Leyte natural park한겨레[포토] “네가 가라 호르무즈” 파병 반대 행진 나선 시민들UOLTrump abre caminho para caçar lobos antes quase extintosThe Sydney Morning HeraldChild dead after fire rips through Central West homeDaily MailFacing the imminent arrival of 1,250 male migrants, ROBERT HARDMAN reveals how women in an Oxfordshire village are fighting back매일경제남편 불륜에 꺼내 입은 ‘파격의 블랙’…다이애나비 ‘복수 드레스’ 4억원에 경매SRF NewsDie etwas anderen News – Alternativlose Alternative für Deutschland?
The Daily Newsstand · Free, Always
Saturday, September 12, 2026

Почему Seedance 2.5 и Hailuo H3 игнорируют промпт и как это исправить 3D-сценой

Translate

Илья Трикоз

разработчик и сооснователь GPTunneL

Я Илья Трикоз, сооснователь и разработчик GPTunneL. И сегодня расскажу вам про вещь, которую мы сделали, когда задолбались смотреть, как дорогая видеомодель раз за разом придумывает свою режиссуру вместо той, что мы просили.

Но теперь ролик можно собрать иначе:

  1. сгенерить 3D-сцену из примитивов, расставить камеры;

  2. получить рендер-референс, по которому Seedance 2.5 или Hailuo H3 повторят все движения один в один.

Ракурс, тайминг, каты – всё предсказуемо, всё остаётся на холсте, и любой шаг можно переиграть. Вместо того чтобы уговаривать модель текстом, мы показываем ей на пальцах (точнее, на кубиках).

Итак, встречайте: нода «3D-сцена» в конструкторе воркфлоу.

Зачем вообще кубики

Современные видеомодели, например Seedance 2.5, MiniMax Hailuo, рисуют картинку выше всяких похвал. А вот с режиссурой у них плохо. Пишете промпт:

«Камера медленно поднимается из-под земли, ловит в фокус орла и пикирует за ним к полю»

– модель по-честному попытается, но выполнит по-своему. Орёл будет, поле будет, а того самого пролёта – может, и нет. И вы садитесь перегенерировать. Пятый дубль, десятый – как будто объясняешь дорогу, а всё время сворачивают не туда, потому что «так быстрее».

В кино это решили задолго до нейросетей – превизом. Перед съёмкой сцену блокируют серыми примитивами: где камера, куда она едет, где актёры. Простыми болванками договариваются о мизансцене (расположении актёров/предметов/декораций), пока не вдаваясь детали.

Пример использования серых примитивов в превизуализации для кино – тот самый подход, который мы применили для видеомоделей. [Источник: The Third Floor]

Пример использования серых примитивов в превизуализации для кино – тот самый подход, который мы применили для видеомоделей. [Источник: The Third Floor]

Для генеративного видео этот приём нужен даже больше.

Как это работает

Мультимодальные модели, такие как Seedance 2.5 и MiniMax Hailuo H3, принимают видеореференс. Если объяснить, что референс задаёт только камеру, тайминг и расположение, а внешний вид берётся из текста и картинок, то модель повторяет операторскую работу почти один в один.

Сценарий простой: добавляете на холст ноду «3D-сцена», описываете в чате, что должно происходить (можно поправить руками результат, если ассистент понял не так), жмёте рендер и подключаете выходы к видеомодели – video как референс, prompt как инструкцию.

Можно добавить референсные изображения персонажей. Модель возьмёт из них внешний вид, а из превиза – движение.

Шаблон «3D-сцена» в воркфлоу GPTunneL. Выходы video и prompt подключены напрямую к ноде генерации видео

Шаблон «3D-сцена» в воркфлоу GPTunneL. Выходы video и prompt подключены напрямую к ноде генерации видео

Может показаться, что тридэ – что-то очень сложное, но здесь это не так. Сцену собирает ассистент по вашему тексту, а руками остаётся только подвинуть что-то, если модель поняла чуть не так.

От муравья под землёй до трактора в поле

В начале статьи был ролик: за 30 секунд на холсте вырастает узнаваемая 3D-модель из простых фигур. Переключаешь вкладку на «Анимацию» – и там тоже всё уже готово.

Теперь пример посерьёзнее – сцена задумана как один пролёт на 15 секунд:

Тайминг

Что происходит

0:00–0:03

Крупный план внутри тоннеля: муравей едва заметно двигает усиками

0:03–0:05

Подъём камеры через толщу земли с торможением у входа в крысиную нору

0:05–0:08

Прорыв сквозь стебли травы наружу, вдалеке появляется орёл

0:08–0:11

Пролёт над долиной среди гор, ниже видны поля и трасса

0:11–0:15

Резкое снижение к полю с выходом в хвост движущемуся трактору

Пять абзацев, четыре смены масштаба – от сантиметров до километров.

Вряд ли какая видеомодель сделает такой задуманный пролёт с первого промпта. А в ноде эта раскадровка целиком уходит в чат ассистенту, и через полминуты на холсте стоит сцена из 120 объектов с одной камерой, ключами по всему пути и катами по таймкодам.

Редактор 3D-сцены: примитивы для всех героев сюжета, траектория камеры и таймлайн с ключами анимации

Редактор 3D-сцены: примитивы для всех героев сюжета, траектория камеры и таймлайн с ключами анимации

Ракурс, тайминг и порядок планов в готовом ролике совпадают с превизом почти покадрово: где в сцене куб уходит вверх сквозь грунт, там в ролике камера вырывается сквозь траву в небо.

Что внутри ноды

Сцена хранится как обычный документ: длительность, фон, объекты, камеры, свет, список катов. Объекты – четыре примитива: куб, сфера, пирамида и группа. Группа невидима, это пивот: у неё дети с локальными координатами, поэтому трактор из кузова, кабины и колёс едет как одно целое, а орёл не теряет крыло на вираже.

Анимация – ключи по времени на позицию, поворот и масштаб, у камер ещё на точку взгляда и угол обзора. Редактируется мышью: гизмо, дерево объектов с инспектором, таймлайн, undo/redo.

Принципиальный момент архитектуры: состояние сцены в момент времени считает одна и та же функция, и её же используют превью во вьюпорте, гизмо и офлайн-рендер в файл. То, что видно при проигрывании, гарантированно совпадает с результатом рендера (потому что иначе не может быть в принципе).

Рендерить решили на клиенте, а не на сервере – сцена лёгкая, а сервер занят генерациями. Кадры рисует WebGL-рендерер детерминированно.

Быстрый путь – WebCodecs: кадр с canvas превращается в VideoFrame и уходит аппаратному H.264-кодировщику, ffmpeg.wasm только упаковывает поток в mp4. Восемь секунд в 720p кодируются за секунды. Ну а запасной путь для браузеров без WebCodecs – PNG-кадры чанками через ffmpeg.wasm.

Пара граблей:

  • сырой RGBA не подходит (30 секунд при 30 fps – уже 3,3 ГБ в памяти);

  • у ffmpeg.wasm один инстанс на вкладку, рендер сцены и видеоредактор делят его через общий замок;

  • лимит WebGL-контекстов в браузере около шестнадцати – после рендера контекст нужно явно «терять», иначе вьюпорт перестаёт рисоваться.

Главная битва: как заставить модель говорить коротко

Если бы вы спросили меня в начале проекта, что сложнее – 3D-графика или общение с LLM, я бы поставил на графику. Ошибся.

Первая версия ассистента работала в лоб: в промпт кладём JSON-схему и текущую сцену, просим вернуть новый документ целиком. Получилось долго: на задаче «человек входит в комнату и ложится на кровать» ответ занимал около 9500 токенов и полторы минуты, а «подвинь кровать левее» стоило столько же, сколько сцена с нуля. Да и ненадёжно: длинный JSON с сотнями чисел модель регулярно ломала – то запятую потеряет, то ключ переименует. К тому же без иерархии голова отрывалась от тела при повороте, дверь вращалась сквозь стену… Ну вы поняли.

Мы собрали стенд с тестовыми задачами, автоматической оценкой по геометрическим эвристикам и учётом токенов – и начали менять формат.

Шаг 1. Текст вместо JSON. Одна строка на сущность, ключи анимации строками с отступом, умолчания не пишутся:

scene dur=8 bg=#1b1d24
box floor "Пол" #8a8a8a p=0,-0.05,0 s=6,0.1,6
group car "Машина" #b03030 p=-5.3,0,0
box car_body "Кузов" #b03030 parent=car p=0,0.6,0 s=4,0.8,1.8
  @0 p=-5.3,0,0
  @6 p=5,0,0 ease=easeInOut
cam cam_1 "Общая" p=6,3,8 t=0,1,0 fov=50
cut 0 cam_1

Ответ стал короче в два-три раза, а парсер прощает то, чего не простит JSON. Плюс такой ответ можно применять построчно во время стриминга – сцена собирается по мере печати.

Шаг 2. Патчи вместо документа. Модель отвечает только изменениями: строка с известным идентификатором заменяет сущность, с новым – добавляет, отдельная команда удаляет. «Подвинь кровать» превратилось в одну строку вместо переписывания всего документа.

Шаг 3. Макросы. Самое интересное решение. Модель плохо считает геометрию, зато отлично понимает, что нужно сделать. Мы вынесли типовые конструкции в макросы, которые разворачивает обычный код: комната с дверью, человек с пивотом в ногах, «пройти по точкам», «лечь на кровать», «камера с чистой линией взгляда». Модель пишет одну строку, а обход мебели и угол камеры считает не она.

Результат: ответ ужался до 300 токенов – в 30 раз меньше исходного JSON, в 12 раз дешевле, в 13 раз быстрее. Качество по эвристикам стенда выросло с «иногда» до 10 из 10. Редкий случай, когда оптимизация – решение одновременно быстрее, дешевле и качественнее.

Шаг 4. Линт и один повтор. Остаток ошибок ловит геометрическая проверка после применения ответа: объект под полом, камера сквозь стену. Замечания уходят модели одним коротким запросом, и одного повтора почти всегда хватает.

Ещё нюанс: reasoning-модели тщательно думают перед ответом, а для сборки из готовых макросов долгие раздумья не нужны. Низкий уровень усилий на размышление режет расход ещё в несколько раз без потери качества.

Из этой экономики складывается цена: сцена через ассистента стоит от 10 до 100 ₽. Причём рендер 3D-заготовки в mp4 бесплатный – идёт на вашем компьютере.

Промпт для видеомодели идёт в комплекте

Превиз выглядит как цветные кубики на ровном фоне. Отдай его модели без объяснений – она сделает video-to-video: «улучшит» кубики и вернёт те же кубики, только красивее.

Поэтому у ноды есть второй, текстовый выход, в котором инструкции, как нужно воспринимать видео на самом деле:

  • готовая инструкция – из видео брать только камеру, планы, тайминг и расположение объектов;

  • каждый примитив считать заглушкой для реального объекта;

  • цвет примитива не считать цветом объекта.

Формулировку подбирали на Seedance 2.5 и Hailuo H3 (у обеих есть конвенция явно назначать роль референсного видео).

Интересно то, что длинные списки запретов работали хуже короткой позитивной инструкции «операторскую работу бери из референса, объекты и атмосферу из описания» (модели, похоже, как и люди, лучше реагируют на позитивные формулировки).

В конце концов к инструкции пользователь дописывает своё описание сцены и референсы персонажей.

Погоня за ожившим столбом

Ещё сцена – машина гонится за человеком, три ката: общий план, крупный, отъезд камеры. 3D-сцена из 50 объектов через ассистента обошлась в 14 ₽.

Превиз, ушедший в видеомодель: красный кузов на серой дороге, зелёные сферы вместо деревьев. С референсами человека и машины Seedance 2.5 вернула зимнюю дорогу в сумерках, битую шестёрку и снежную пыль из-под колёс. Все расстановки (каты, камера) из превиза сохранились.

Чем это отличается от Higgsfield 3D Jutsu

4 сентября Higgsfield выпустил 3D Jutsu – браузерный редактор, где агент на GPT-6 Astra собирает сцену по описанию, а рендерит видеомодель. Мы решали ту же задачу параллельно.

Higgsfield 3D Jutsu

3D-сцена в GPTunneL

формат работы

самостоятельная программа, экспортированные файлы нужно переносить в другие сервисы

встроенная нода прямо на рабочем холсте, соседствует с блоками видео и монтажа

сборка сцены

занимается агент на базе GPT-6 Astra; в режиме Auto запросы ничего не стоят, а выбор конкретной модели снимает кредиты (примерно 17 за одно сообщение у GPT-6 Astra)

сборкой занимается ассистент, работающий через компактные патчи и макросы, стоимость сцены 10–100 ₽

работа с объектами

можно подгружать готовые модели GLB и персонажей из Mixamo, выгрузка в GLB или mp4

только базовые геометрические фигуры и группы, выгрузка в mp4

финальная генерация

видео делают модели самого Higgsfield, списание идёт с подписочных кредитов

доступны Seedance 2.5, Hailuo H3 и другие модели каталога, оплата за фактическое использование

условия оплаты

помесячная подписка минимум $19 за 270 кредитов, платить нужно иностранной картой

не фиксированная подписка, принимаются карты РФ, расчёт в рублях

внесение изменений

перегенерация не требуется — можно двигать объекты вручную или командами в чате

перегенерация не требуется — доступны гизмо, панель инспектора, чат и отмена действий

У Higgsfield шире библиотека ассетов – готовые GLB и анимированные персонажи Mixamo сразу дают узнаваемые силуэты. У нас пока примитивы, зато сцена стоит на том же холсте, что видеомодель, монтаж и извлечение кадров.

Сколько это экономит

Итак, первичная 3D-сцена генерируется общим инструментом, а затем выбираем один из мощных видеогенераторов – Seedance 2.5 или Hailuo H3.

Seedance 2.5

Секунда Seedance 2.5 в 720p стоит 46,2 ₽, ролик на 15 секунд – около 700 ₽ за прогон без референса. Добиться сложного пролёта промптом с десяти попыток – это 7 т. р. ₽ и пару часов ожидания. Сцена через ассистента – 10–100 ₽, рендер бесплатный, а дальше один-два прогона по референсу.

Hailuo H3

Для Hailuo H3 пропорция та же: 768p стоит 12 ₽ за секунду, и когда важно точное движение камеры и объектов – пять лишних дублей опять же дороже, чем сцена через этот воркфлоу «3D-сцена».

Ролик из первого примера сгенерирован в 480p с 15-секундным референсом – весь прогон стоит около 370 ₽. Точный расчёт – в калькуляторе на странице цен, актуальные цифры всегда там.

Мелочи, которые оказались важными

Несколько технических решений, которые пользователь почти не замечает, но без них работа с нодой была бы заметно менее удобной.

Постепенное обновление сцены.

Ответ ассистента применяется сразу по мере стриминга. Если генерация закончилась ошибкой, изменения можно целиком откатить; удачная правка попадает в общий undo, как обычное действие редактора.

Корректный пивот для групп.

При объединении объектов редактор ставит точку вращения в центр группы и переводит дочерние элементы в локальные координаты. Благодаря этому положение объектов в мире сохраняется, а гизмо оказывается непосредственно возле них, а не где-то в начале сцены.

Контроль кеша.

Поскольку воркфлоу может повторно использовать результаты уже выполненных нод, для 3D-сцены отдельно определили признаки устаревшего результата. Иначе после изменений нода могла продолжать отдавать старый рендер.

Общий код для клиента и сервера.

Парсер, макросы, линтер, валидатор и промпт видеомодели вынесены в единый пакет. Это исключает ситуацию, когда браузер интерпретирует сцену одним способом, а сервер проверяет её уже по другим правилам.

Что это меняет

3D-сцена появилась как ещё одна нода рядом с генерацией изображений и видео, LLM-нодами, извлечением кадров и видеоредактором с таймлайном – по возможностям близким к CapCut. Раньше сцена собиралась в одном сервисе, референсы готовились в другом, ролик генерировался в третьем, монтаж – в четвёртом, и файлы постоянно ходили между инструментами, как поезда по расписанию. Теперь всё это один экран, и каждый шаг можно переиграть, не вынося файлы наружу!

Higgsfield и мы пришли к одному выводу почти одновременно: следующий шаг управления видеомоделями не в промптах, а в геометрии. Модель точнее повторяет то, что ей показали, чем то, что ей описали. Логично: даже человеку показать проще, чем объяснить – вспомните любую попытку продиктовать по телефону дорогу, когда рядом есть просто карта.

Как запустить

Нода «3D-сцена» доступна в конструкторе воркфлоу GPTunneL всем пользователям:

GPTunneL® - Нейро-офис и агрегатор нейросетей

gptunnel.ru

Добавьте её на холст, опишите сцену в чате или соберите руками, подключите выходы к Seedance 2.5 или Hailuo H3.

Быстрее всего начать с готового шаблона с орлом и трактором, откройте его и подставьте свою раскадровку:

GPTunneL® - Нейро-офис и агрегатор нейросетей

gptunnel.ru

Вопросы и ответы вдогонку:

  • Нужно ли уметь работать в 3D-редакторах? Нет. Сцену собирает ассистент, руками остаётся подвинуть объект или переставить камеру. Знать Blender не требуется.

  • Какие видеомодели понимают видеореференс? Промпт подобран на Seedance 2.5 и MiniMax Hailuo H3.

  • Можно ли загрузить свою 3D-модель? Пока нет, сцена собирается из примитивов и групп.

  • Сколько стоит рендер превиза? Нисколько. Платите только за ассистента (10–100 ₽) и генерацию видеомоделью.

  • Это аналог Higgsfield 3D Jutsu? По задаче да. Отличия: у нас сцена встроена в воркфлоу рядом с генерацией и монтажом, нет подписки, оплата в рублях.

А какие подходы к этой задаче используете вы? Если работали с геометрией, структурированными ответами LLM или придумывали собственные способы ужимать такие ответы — поделитесь в комментариях. Особенно интересно, какие форматы и приёмы у вас помогают сделать взаимодействие с моделью короче, надёжнее и дешевле.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.