InquirerPalace to Pia Cayetano on fear for her liberty: Is this paranoia? Don’t panicESPNGilmore, '19 NFL DPOY, retires as member of PatsRTP DesportoUEFA e CONCACAF pedem dados à FIFA sobre projeto de privatizar MundiaisESPN Deportes¿Con un Joel Embiid saludable, los 76ers son imparables?Daily MaverickAGE OF ACCOUNTABILITY: Five criminal cases later, Ekurhuleni fires Julius MkhwanaziThe Jerusalem PostSaudi Aramco suspends European crude deliveries after East-West pipeline attack - reportוואלהבן 30 נפל מסוס באום אל פחם: מצבו קשהComplete Sports‘He Has To Go’ –Germany FA Tells InfantinoGlobal NewsOttawa mayoral candidate charged for alleged death threats against Sutcliffe, FordNOSAmerikaanse sancties raken vooral middenstand Iran: 'Geen mens kan dit volhouden'الشرقمعارك شمال كردفان.. الجيش السوداني يوسع انتشاره حول سودريWirtualna PolskaSypią się donosy. Kto w Polsce donosi najczęściej?
The Daily Newsstand · Free, Always
Friday, September 18, 2026

ИИ для оживления фото в 2026 году: топ нейросетей для клипов из одного снимка

Translate

Одна фотография, пять видеомоделей, 662 рубля и полтора часа работы. Так выглядит ответ на вопрос «сколько стоит оживить фото нейросетью в 2026 году», если не пересказывать чужие обзоры, а открыть генерацию видео в BotHub и понажимать кнопки самому.

Дальше начинается то, чего в обзорах обычно нет. Списание ни у одной модели не совпало с той ценой, которая написана у неё же в каталоге, и разошлось в обе стороны: Grok списал втрое меньше прайса, Hailuo почти вдвое больше. Разброс фактической цены за один и тот же пятисекундный ролик вышел одиннадцатикратный, от 14 до 160 рублей.

Если регистрируетесь впервые, вот реферальная ссылка: по ней на счёт зачисляется 300 000 токенов.

Сразу про жанр, чтобы не было обманутых ожиданий. Это разбор про деньги, скорость и надёжность: сколько стоит секунда, за что вы платите на самом деле, какая модель принимает готовый кадр, а какая падает. Покадровое сравнение картинки, у кого поплыли пальцы и кириллица на вывеске, пойдёт отдельной второй частью.

Год в заголовке стоит не для красоты. Поколение моделей сменилось целиком: в прошлогодних подборках блога первыми номерами шли Kling 1.6, Hailuo 02, Runway Gen-3 и Pika 1.5. Kling 1.6 и Gen-3 в каталоге остались, но держатся там уже ценой, а не качеством, Hailuo дорос до версии 2.3, а Pika в каталоге сейчас нет вовсе.

Что поменялось за год

Блог мерил это дважды: топ бесплатных нейросетей для анимации картинок в августе 2025 и топ-12 нейросетей для создания видео и оживления картинок в сентябре того же года. В тех обзорах стояли Runway Gen-3 Alpha Turbo и Gen-4 Turbo, Pika 1.5, Kling 1.6, Hailuo 01 и 02.

Сейчас в видеоразделе каталога 39 моделей. Kling дошёл до третьей версии, Hailuo до 2.3, у Google появилась Veo 3.1, у OpenAI Sora 2, у ByteDance Seedance 2.5.

Но главное изменение не в номерах версий, а в звуке. Год назад ролик из фотографии выходил немым, и дорожку подкладывали отдельно, из другого сервиса. Сейчас Veo, Sora и Kling генерируют звук одновременно с картинкой, включая шаги, шум улицы и речь персонажей.

Второе изменение менее приятное. Старые модели были дешёвыми или условно бесплатными с водяным знаком, новые стоят денег, и заметных. Секунда на старшей Veo 3.1 обходится в 70,71 ₽, то есть восьмисекундный ролик выходит в 565,71 ₽.

Три разные вещи, которые называют оживлением фото

Когда пишут «нейросеть оживляет фото», имеют в виду один из трёх режимов, и путать их дорого.

Анимация кадра означает, что ваш снимок становится первым кадром ролика, а модель достраивает движение вперёд. Лицо, свет и фон остаются вашими. За этим обычно и приходят со старой семейной фотографией.

Совсем другое дело генерация по референсу. Снимок там работает образцом: модель снимает с него внешность, стиль или композицию и рисует новую сцену. На выходе похожий человек в другом месте, а не ваш кадр в движении.

Есть ещё перенос движения, когда траектория берётся из чужого ролика и накладывается на ваш кадр. В каталоге под это лежат отдельные модели с приставкой motion-control.

Разница видна сразу, как только в кадре появляется знакомое лицо. Если нужно, чтобы на видео осталась именно бабушка с фотографии, а не похожая на неё женщина, вам нужен первый режим. На карточке модели он подписан «Картинка в видео», и есть он не у всех.

Где это лежит в сервисе

Мест два, и они не равнозначны.

Первое, лендинг генерации видео. Там четыре модели: veo-3.1-fast, gen3a_turbo, sora-2-pro и kling-v3-video. На вход принимаются JPG и PNG, в справке лендинга написано: «Максимальная длительность видео - 10 секунд, разрешение - до 1920х1080». Порядок работы в четыре шага: выбрать модель, описать сцену, настроить параметры, загрузить изображение и запустить.

Второе, полный каталог. Тридцать девять видеомоделей на 17 сентября 2026 года, от 2,30 до 70,71 ₽ за секунду. У каждой своя карточка, и на карточке видно, есть ли режим «Картинка в видео».

Скриншот 01. Блок цен на лендинге генерации видео: четыре модели и цена за секунду

Скриншот 01. Блок цен на лендинге генерации видео: четыре модели и цена за секунду

Разница между четырьмя моделями и тридцатью девятью тут не про полноту. Три модели из четырёх на лендинге это верхний ценовой сегмент, а самое интересное для оживления фото лежит в середине списка, о чём ниже.

Сколько стоит секунда

Цены публичные, те, что видит незалогиненный читатель на карточке модели. Проверено 17 сентября 2026 года.

Модель

Вендор

₽ за секунду

Ролик 5 секунд

Звук вместе с видео

Grok Imagine Video

xAI

5,89

29,45 ₽

нет данных на карточке

Veo 3.1 Lite

Google

8,84

44,20 ₽

да

Hailuo 2.3

MiniMax

9,63

48,15 ₽

нет данных на карточке

Kling V2.6

Kuaishou

12,38

61,90 ₽

да

sora-2

OpenAI

17,68

88,40 ₽

да, с речью

Seedance 2.5

ByteDance

18,17

90,85 ₽

нет данных на карточке

Veo 3.1 Fast

Google

26,52

132,60 ₽

да

kling-v3-video

Kuaishou

29,70

148,50 ₽

да

Sora 2 Pro

OpenAI

53,04

265,20 ₽

да, с речью

Veo 3.1

Google

70,71

353,55 ₽

да

Между верхней и нижней строкой таблицы двенадцатикратная разница за один и тот же пятисекундный ролик. Ещё две вещи про то, как читать эти цифры.

Цена на карточке подписана «Генерация видео (длительность 8 сек.)». Это не тариф за ролик, а посекундная ставка, умноженная на восемь. Сходится до копейки на всех проверенных моделях: Hailuo 2.3 даёт 9,63 × 8 = 77,04 при 77,03 на карточке, kling-v3-video 29,70 × 8 = 237,60 ровно столько же. Считать удобнее в секундах.

Версия 1080p везде ровно на 20% дороже, чем 720p. Никаких исключений в каталоге я не нашёл.

Самый дешёвый низ каталога это семейство ltx от Lightricks, от 2,30 ₽ за секунду. Карточки у части этих моделей пустые, вместо описания стоит заглушка «Ботхабчики собирают информацию», поэтому ссылку на них давать не буду, ищите в каталоге по фильтру видео.

Kling V3: дорого, и берут за физику

Начну с неприятного. kling-v3-video стоит 29,70 ₽ за секунду, это вторая цена в каталоге после старшей Veo. Пятисекундный ролик из вашей фотографии обойдётся в 148,50 ₽, и если первый дубль не понравился, второй стоит столько же.

Платят за поведение материи. В описании модели перечислено то, на чём обычно и рассыпается оживление фото: «правдоподобная физика: инерция в движении тела, поведение ткани и жидкостей, естественная мимика». Инерция здесь слово рабочее. Дешёвые модели двигают человека так, будто он собран из картона: голова поворачивается, а плечи стоят. Волосы и одежда выдают подделку быстрее лица.

Режим для фотографии у Kling называется прямо: «оживить фото нейросетью или раскадровку». То есть снимок идёт первым кадром, а не референсом.

Есть версия дешевле, Kling V2.6, 12,38 ₽ за секунду, в два с лишним раза меньше. Режим «изображение-в-видео, когда загруженный кадр приходит в движение» у неё тоже есть, плюс нативный звук и заявленный вывод вплоть до 4K. Если бюджет ограничен, пробовать разумнее с неё, а к третьей версии переходить, когда станет понятно, чего не хватает.

Доступно в BotHub: kling-v3-video.

Hailuo 2.3: сделана ровно под эту задачу

Из всего списка это единственная модель, у которой работа с готовым кадром вынесена в первую строку описания: «видеомодель MiniMax для генерации видео по текстовому описанию или по референсному изображению».

Формулировка про режим оживления у MiniMax точнее, чем у остальных: «движение и сцена достраиваются из готового кадра». Референс держит композицию, стиль и внешность персонажа, и описывать словами, как выглядит человек на фотографии, не нужно. Для старого снимка это важно: чем меньше вы объясняете модели, кого она видит, тем меньше шансов, что она пририсует своё.

Цена 9,63 ₽ за секунду, то есть пятисекундный ролик стоит 48,15 ₽, втрое дешевле Kling V3.

Доступно в BotHub: Hailuo 2.3.

Три Veo, и разница между ними в восемь раз

У Google в каталоге три версии одной модели, и это тот случай, когда перед выбором стоит посмотреть на цену, а не на название.

Версия

₽ за секунду

Ролик 5 секунд

Veo 3.1 Lite

8,84

44,20 ₽

Veo 3.1 Fast

26,52

132,60 ₽

Veo 3.1

70,71

353,55 ₽

Восьмикратная разница между младшей и старшей. При этом звук по тексту карточек есть у всех трёх: у Lite «звуковая дорожка создаётся сразу вместе с видео и синхронизирована с ним», у старшей «синхронный звук», созданный нативно.

Официальная документация Google формулирует набор возможностей так: «Veo 3.1 is a model for generating video with native audio. It supports features like video extension, frame-specific generation, and image-based direction». Последнее, image-based direction, и есть оживление кадра.

Что именно даёт восьмикратная доплата, по карточкам не поймёшь. Обе описаны через 1080p и синхронный звук, разница обозначена только словом Lite. Это как раз тот вопрос, на который отвечает свой прогон, а не пресс-релиз.

Доступно в BotHub: Veo 3.1 Lite, Veo 3.1 Fast, Veo 3.1.

Sora 2: когда на фотографии должны заговорить

Единственная модель в списке, про которую на карточке написано, что она генерирует речь персонажей: «дорожка генерируется вместе с картинкой, включая речь персонажей, шаги, шум улицы и музыкальный фон».

Заявлено, что модель держит многошотовые сцены, несколько планов подряд с одним героем, одной локацией и сохранённым освещением. Для оживления одной фотографии это скорее избыточно, а вот для случая «фотография как первый кадр небольшой сценки» уже нет.

Опорное изображение модель принимает, разрешение заявлено вплоть до 4K. Цена 17,68 ₽ за секунду у обычной версии и 53,04 ₽ у Pro, разница втрое.

Предупрежу заранее: генерация речи по фотографии реального человека это отдельный сюжет с согласием и правами, и к технике он отношения не имеет. Прежде чем заставлять говорить чужое лицо, стоит подумать, чьё оно.

Доступно в BotHub: sora-2 и Sora 2 Pro.

Seedance 2.5: про продолжение, а не про оживление

Модель ByteDance описана как инструмент «для длинных сюжетных роликов, генерации видео по референсам, монтажа и продления сцен». Раздел «Картинка в видео» на карточке есть, но без подробностей, зато отдельно упомянуто управление опорными кадрами и то, что на ней оживляют концепт-арт по референсу.

Читать это стоит так: на одной фотографии её сильные стороны не раскрываются. Брать Seedance имеет смысл, когда кадров несколько и нужна связная сцена, а не пятисекундное движение одного портрета. Цена 18,17 ₽ за секунду.

Доступно в BotHub: Seedance 2.5.

Grok Imagine Video: единственная с внятной длительностью

С этой моделью интересна не цена, хотя 5,89 ₽ за секунду это самая низкая цена в таблице выше, а то, что на её карточке вообще написаны технические пределы. В каталоге есть и версия посвежее, Grok Imagine Video 1.5 за 9,43 ₽ за секунду, её я и гонял.

  • длительность от 1 до 15 секунд

  • 24 кадра в секунду

  • 480p или 720p

  • семь соотношений сторон, горизонтальных и вертикальных

  • три режима: по тексту, из изображения, по референсу

Остальные карточки таких таблиц не содержат, там везде «8 сек., 720p» в прайсе и общие слова в описании. И вот тут вылезает расхождение: лендинг обещает до 10 секунд, прайс на карточках построен на восьми, а Grok заявляет пятнадцать. Кто из них прав, видно в интерфейсе, и об этом следующий раздел.

Доступно в BotHub: Grok Imagine Video.

Что ещё есть в каталоге и почему я туда не веду

В списке видеомоделей лежат kling-v3-motion-control, kling-v2.6-motion-control и ltx-2-retake, то есть перенос движения и пересборка готового ролика. Для фотографии это следующий шаг после оживления, когда движение хочется задать своим примером, а не словами.

Карточки у них пустые. Вместо описания стоит «Ботхабчики собирают информацию», и цена. Вести читателя на такую страницу смысла нет, поэтому ссылок здесь не будет, а модели названы для тех, кто пойдёт искать в каталоге сам. На 17 сентября 2026 года пустыми у видеораздела оказались карточки ltx-2-fast, kling-v3-motion-control и gen3a_turbo, а gen4-turbo отдаёт 404, хотя сама модель в каталоге есть.

Что стоит проверить до первого запуска

Настройки генерации живут за шестерёнкой рядом с полем промпта, и по умолчанию там стоит не то, что вы, скорее всего, ожидаете.

Длительность задаётся ползунком от 3 до 15 секунд, и по умолчанию он стоит на тройке. Мой первый ролик вышел трёхсекундным ровно поэтому. Заодно это ответ на вопрос про десять секунд с лендинга: в интерфейсе потолок пятнадцать.

Режим генерации по умолчанию стоит на «Профессиональном (1080p)», а не на стандартном. Подпись под переключателем честная: «Влияет на качество и стоимость». То есть дефолт у вас дорогой.

Тумблер «Создавайте аудио вместе с видео» тоже включён сразу, и выключать его никто не предлагает.

Последнее поле это мультипромптинг, туда кладётся JSON вида [{"prompt":"...","duration":3},{"prompt":"...","duration":2}]. Ролик разбивается на сцены со своими промптами и длительностью. Для оживления одной фотографии это перебор, а для маленькой сценки уже нет.

Скриншот 03. Ползунок длительности по умолчанию стоит на трёх секундах

Скриншот 03. Ползунок длительности по умолчанию стоит на трёх секундах

Прогон: одна фотография, пять моделей

Обзоры оживления фото обычно делают на витринном материале: закат, кот, девушка с распущенными волосами на ветру. На таком кадре хорошо выглядит всё, потому что ошибку негде заметить. Я собрал обратное.

Исходник сгенерировал в том же BotHub моделью nano-banana-pro за 26,98 ₽: так в кадре оказалось ровно то, на чём модели обычно ломаются, и никого живого я под нейросети не подставил.

Что в кадре и зачем:

  • руки с видимыми пальцами, мужчина держит раскрытую газету

  • кириллическая вывеска «ПРОДУКТЫ» и мелкая строка «работаем с 8 до 22»

  • очки с тонкой металлической оправой

  • два лица рядом

  • мелкий геометрический узор на платье

Скриншот 04. Исходный кадр

Скриншот 04. Исходный кадр

Что писать в промпте

Промпт под оживление фотографии устроен наоборот по сравнению с обычной генерацией видео. Там вы описываете сцену, здесь сцена уже есть, и задача промпта её не сломать. Поэтому в тексте у меня три запрета и ни одного красивого слова: без смены плана, без новых объектов, камера почти неподвижна.

Длинное кинематографичное описание тут работает против вас: чем больше вы рассказываете модели про свет, ракурс и настроение, тем охотнее она перерисует кадр по-своему. Движение стоит называть минимальным и конкретным, вроде «моргают», «газета колышется».

Промпт один на все модели: «Оживи фотографию: лёгкое естественное движение, люди чуть шевелятся и моргают, газета слегка колышется, камера почти неподвижна. Без смены плана и без новых объектов в кадре». Параметры одинаковые: 5 секунд, стандартный режим 720p, аудио включено.

Модель

Сколько ждал

Списано по факту

По прайсу за 5 секунд

Результат

grok-imagine-video-1.5

меньше минуты

14,18 ₽

47,15 ₽

ролик получен

hailuo-2.3

около полутора минут

86,98 ₽

48,15 ₽

ролик получен

sora-2

около полутора минут

106,38 ₽

88,40 ₽

ролик получен

veo-3.1-fast

меньше минуты

159,57 ₽

132,60 ₽

ролик получен

kling-v3-video

около двух минут

268,14 ₽

90,29 ₽

ролик 3 секунды, 1440×1440

Kling я запускал первым, на заводских настройках, то есть 1080p и три секунды. Остальные четыре шли на одинаковых 720p и пяти секундах.

Весь прогон вместе с исходной картинкой обошёлся в 662,23 ₽.

Списание не сходится с посекундной ценой

Вот это главное, что я вынес из прогона.

Берём цену за секунду из каталога, умножаем на пять, раз я просил пять секунд, и сравниваем с тем, что реально ушло со счёта:

Модель

₽ за секунду

Прайс × 5

Списано

Разница

grok-imagine-video-1.5

9,43

47,15 ₽

14,18 ₽

в 3,3 раза меньше

hailuo-2.3

9,63

48,15 ₽

86,98 ₽

в 1,8 раза больше

sora-2

17,68

88,40 ₽

106,38 ₽

на 20% больше

veo-3.1-fast

26,52

132,60 ₽

159,57 ₽

на 20% больше

Сходства нет ни в одну сторону. А если поделить списание на каталожную цену секунды, выходят множители 1,5 у Grok, 6,0 у Sora и Veo, 9,0 у Hailuo. Пятёрки, которую я заказывал, среди них нет ни у кого.

Отсюда практический вывод: посекундная цена в каталоге это ориентир порядка величины, а не калькулятор. Прежде чем ставить генерацию видео в рабочий процесс с понятной сметой, прогоните один ролик и посмотрите на фактическое списание, оно показывается прямо под ответом.

Скриншот 05. Hailuo 2.3, списание 86,98 ₽

Скриншот 05. Hailuo 2.3, списание 86,98 ₽

Скриншот 06. Sora 2, списание 106,38 ₽

Скриншот 06. Sora 2, списание 106,38 ₽

Скриншот 07. Veo 3.1 Fast, списание 159,57 ₽

Скриншот 07. Veo 3.1 Fast, списание 159,57 ₽

Скриншот 08. Grok Imagine Video 1.5, списание 14,18 ₽

Скриншот 08. Grok Imagine Video 1.5, списание 14,18 ₽

Сколько ждать

Veo 3.1 Fast и Grok укладываются меньше чем в минуту. Hailuo и Sora просят около полутора. Kling V3 около двух. Для задачи «оживить одну фотографию» это означает, что перебрать три-четыре модели и выбрать лучший дубль реально за один присест, а не за вечер.

Что выбрать под свою задачу

Задача

Что брать

Почему

Попробовать, не потратив заметных денег

grok-imagine-video-1.5

в моём прогоне 14,18 ₽ за пять секунд и меньше минуты ожидания

Оживить старое семейное фото

Hailuo 2.3

режим сделан под достраивание движения из готового кадра, внешность не надо описывать словами

Ролик со звуком и репликой

sora-2

единственная, где на карточке заявлена речь персонажей

Максимальное качество движения

kling-v3-video

физика тела, ткани и жидкостей, мимика. Готовьтесь платить

Скорость

Veo 3.1 Fast

быстрее всех в прогоне, при этом со звуком

Подытожим

Оживление фотографии в 2026 году перестало быть аттракционом и стало строкой расходов. Модели, которые год назад раздавали бесплатно с водяным знаком, сменились платными, и разница в цене между версиями одной и той же модели доходит до восьми раз при неочевидной разнице в результате.

Из этого следуют две практические вещи. Первая: до запуска зайдите в настройки. По умолчанию там три секунды, профессиональный режим и включённый звук, и счёт вы получите именно за такой набор. Вторая: не верьте прайсу на слово. Посекундная цена в каталоге и то, что уходит со счёта, у меня разошлись на всех четырёх моделях, которые я сравнивал честно, и разошлись в обе стороны.

И про выбор модели. Пробовать разумно снизу вверх, потому что на конкретной фотографии дорогая модель не обязательно окажется лучше дешёвой, а стоит ошибка ровно столько, сколько написано в предыдущем абзаце.

Рядом по теме: сколько стоит 25-секундная реклама с ИИ, где на бюджете ролика видно, что генерация видео съедает 88% сметы. И прошлогодний топ нейросетей для анимации картинок, с которым удобно сравнить, как поменялся состав за год.

Каталог моделей, цены и 300 000 токенов новому аккаунту: bothub.ru.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.