The Daily Newsstand · Free, Always
Sunday, October 11, 2026

Пилот ИИ-сериала за 900₽ на GPU c Kandinsky 6: как я проверил, что персонажи вообще говорят

Translate

Я попросил провести эксперимент с коротким сериалом. Агент собрал пилот: ролик на 52,2 секунды, 19 планов, три вымышленных персонажа и английские диалоги. Есть и промо на 22,4 секунды.

Генерация шла на одной арендованной RTX PRO 6000 в Selectel. За сессию вышло четыре оплаченных часа, около 900 ₽.

Kandinsky - показался трагедией

Первую сборку я посмотрел со звуком и понял, что половины разговоров не слышно. Сначала винил Kandinsky. Прогнал расшифровку сырых клипов через Whisper small.en: все 16 реплик произнесены правильно, у 12 совпадение с текстом полное.

Проблема была в сборке. Kandinsky начинает говорить через 2-3 секунды после начала клипа, а сборщик обрезал каждый клип до длины реплики с нулевой секунды. В итог попадала тишина, а речь отрезалась, пошел фиксить.

Агент добавил speech_window(): функция находит первый всплеск громче −42 дБ в окне 50 мс и оставляет 0,25 секунды до него.

Я оставил Kandinsky 6 после сравнения кадров с Wan2.2

Публичного рейтинга, где Kandinsky 6, Wan2.2 и SkyReels-V3 стояли бы рядом, нет. В Artificial Analysis на 10.10 у них нет записи. MiniMax H3 и MAGI-2 в лидерах открытых весов тоже не стали вариантом: H3 требует четыре карты, а его открытая лицензия запрещает использовать или показывать результаты в США, ЕС, Великобритании и Корее (тут как бы спорно, но если делать - то делать хорошо, на весь мир).

На одной карте и на мастер-кадрах получилась такая разница:

Kandinsky 6 Pro (NVFP4, ComfyUI)

Wan2.2-S2V + голос из Qwen3-TTS

Голос

свой на каждый план, между планами плывёт

один на персонажа, реплика точно по тексту

Время на клип 5 с

144 с в тёплом состоянии

≈9 минут при 480×832

Стоимость клипа

≈9 ₽

≈20-35 ₽

Картинка

больше жеста и света

стабильное лицо, спокойная камера; рот иногда движется слишком широко

Лицензия

MIT, но аудио-VAE в рецепте ComfyUI - CC-BY-NC-4.0

Apache-2.0 у Wan и Qwen3-TTS

Wan с зафиксированным голосом выглядит сильнее для диалоговых крупных планов. Я посмотрел первые кадры рядом с Kandinsky и оставил Kandinsky 6 для пилота, мое субъективное мнение.

NVFP4 сократил время Pro до 144 секунд на клип

Kandinsky Pro-distill в NVFP4 через ComfyUI 0.39 дал 144 секунды на warmed-up генерацию клипа. В diffusers с выгрузкой на CPU тот же Pro занимал 238 секунд в тёплом состоянии и 337 секунд при первом портретном запуске.

Агенту пришлось переложить UI-схему ComfyUI в API-вызовы: порядок виджетов не совпадал со входами ноды. В основной ветке ComfyUI нужного файла весов пока нет.

Проверка речи спасла три плана

Для повторных генераций агент добавил три проверки: число лиц и сходство с мастер-кадром; текст в кадре; совпадение реплики по Whisper. Для планов без реплики потребовал тишину: иначе Kandinsky на кадре без слов начинал говорить «Thank you very much».

Планы 11 и 19 стали тихими со второй попытки. План 14 со второй попытки произнёс «You knew?» с совпадением 1.0. План 17 пять раз говорил те же слова, но метрика ставила 0.67 из-за написания «Mister» и «Mr.».

План 5, пустой коридор, не прошёл проверку текста ни разу: она видела «5M» на знаке выхода. Этот знак уже был на мастер-кадре, поэтому нужно переделать именно его.

Дубли проверяла программа, а не человек

Голос Kandinsky генерирует заново в каждом плане, закрепить его за персонажем нельзя, и сходство голосов - не понравилось, я бы делал на Qwen TTS. Музыку из ACE-Step 1.5 (три фона) выбрал вслепую с помощью агента (да, я стараюсь все делать AI-first). Кадры проверяли вместе с агентами, они - счётчиком лиц и распознаванием текста и речи, я - визуально.

Финальный ролик увеличен до 1080×1920 обычным Lanczos, без супер-разрешения. На планшете в первом плане и на знаке в пятом ещё могут остаться артефакты.

p.s. честно пытаюсь прицепить картинку и видео, но не грузятся

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.