ИИ для оживления фото в 2026 году: топ нейросетей для клипов из одного снимка
Одна фотография, пять видеомоделей, 662 рубля и полтора часа работы. Так выглядит ответ на вопрос «сколько стоит оживить фото нейросетью в 2026 году», если не пересказывать чужие обзоры, а открыть генерацию видео в BotHub и понажимать кнопки самому.
Дальше начинается то, чего в обзорах обычно нет. Списание ни у одной модели не совпало с той ценой, которая написана у неё же в каталоге, и разошлось в обе стороны: Grok списал втрое меньше прайса, Hailuo почти вдвое больше. Разброс фактической цены за один и тот же пятисекундный ролик вышел одиннадцатикратный, от 14 до 160 рублей.
Если регистрируетесь впервые, вот реферальная ссылка: по ней на счёт зачисляется 300 000 токенов.
Сразу про жанр, чтобы не было обманутых ожиданий. Это разбор про деньги, скорость и надёжность: сколько стоит секунда, за что вы платите на самом деле, какая модель принимает готовый кадр, а какая падает. Покадровое сравнение картинки, у кого поплыли пальцы и кириллица на вывеске, пойдёт отдельной второй частью.
Год в заголовке стоит не для красоты. Поколение моделей сменилось целиком: в прошлогодних подборках блога первыми номерами шли Kling 1.6, Hailuo 02, Runway Gen-3 и Pika 1.5. Kling 1.6 и Gen-3 в каталоге остались, но держатся там уже ценой, а не качеством, Hailuo дорос до версии 2.3, а Pika в каталоге сейчас нет вовсе.
Что поменялось за год
Блог мерил это дважды: топ бесплатных нейросетей для анимации картинок в августе 2025 и топ-12 нейросетей для создания видео и оживления картинок в сентябре того же года. В тех обзорах стояли Runway Gen-3 Alpha Turbo и Gen-4 Turbo, Pika 1.5, Kling 1.6, Hailuo 01 и 02.
Сейчас в видеоразделе каталога 39 моделей. Kling дошёл до третьей версии, Hailuo до 2.3, у Google появилась Veo 3.1, у OpenAI Sora 2, у ByteDance Seedance 2.5.
Но главное изменение не в номерах версий, а в звуке. Год назад ролик из фотографии выходил немым, и дорожку подкладывали отдельно, из другого сервиса. Сейчас Veo, Sora и Kling генерируют звук одновременно с картинкой, включая шаги, шум улицы и речь персонажей.
Второе изменение менее приятное. Старые модели были дешёвыми или условно бесплатными с водяным знаком, новые стоят денег, и заметных. Секунда на старшей Veo 3.1 обходится в 70,71 ₽, то есть восьмисекундный ролик выходит в 565,71 ₽.
Три разные вещи, которые называют оживлением фото
Когда пишут «нейросеть оживляет фото», имеют в виду один из трёх режимов, и путать их дорого.
Анимация кадра означает, что ваш снимок становится первым кадром ролика, а модель достраивает движение вперёд. Лицо, свет и фон остаются вашими. За этим обычно и приходят со старой семейной фотографией.
Совсем другое дело генерация по референсу. Снимок там работает образцом: модель снимает с него внешность, стиль или композицию и рисует новую сцену. На выходе похожий человек в другом месте, а не ваш кадр в движении.
Есть ещё перенос движения, когда траектория берётся из чужого ролика и накладывается на ваш кадр. В каталоге под это лежат отдельные модели с приставкой motion-control.
Разница видна сразу, как только в кадре появляется знакомое лицо. Если нужно, чтобы на видео осталась именно бабушка с фотографии, а не похожая на неё женщина, вам нужен первый режим. На карточке модели он подписан «Картинка в видео», и есть он не у всех.
Где это лежит в сервисе
Мест два, и они не равнозначны.
Первое, лендинг генерации видео. Там четыре модели: veo-3.1-fast, gen3a_turbo, sora-2-pro и kling-v3-video. На вход принимаются JPG и PNG, в справке лендинга написано: «Максимальная длительность видео - 10 секунд, разрешение - до 1920х1080». Порядок работы в четыре шага: выбрать модель, описать сцену, настроить параметры, загрузить изображение и запустить.
Второе, полный каталог. Тридцать девять видеомоделей на 17 сентября 2026 года, от 2,30 до 70,71 ₽ за секунду. У каждой своя карточка, и на карточке видно, есть ли режим «Картинка в видео».

Разница между четырьмя моделями и тридцатью девятью тут не про полноту. Три модели из четырёх на лендинге это верхний ценовой сегмент, а самое интересное для оживления фото лежит в середине списка, о чём ниже.
Сколько стоит секунда
Цены публичные, те, что видит незалогиненный читатель на карточке модели. Проверено 17 сентября 2026 года.
Модель | Вендор | ₽ за секунду | Ролик 5 секунд | Звук вместе с видео |
xAI | 5,89 | 29,45 ₽ | нет данных на карточке | |
8,84 | 44,20 ₽ | да | ||
MiniMax | 9,63 | 48,15 ₽ | нет данных на карточке | |
Kuaishou | 12,38 | 61,90 ₽ | да | |
OpenAI | 17,68 | 88,40 ₽ | да, с речью | |
ByteDance | 18,17 | 90,85 ₽ | нет данных на карточке | |
26,52 | 132,60 ₽ | да | ||
Kuaishou | 29,70 | 148,50 ₽ | да | |
OpenAI | 53,04 | 265,20 ₽ | да, с речью | |
70,71 | 353,55 ₽ | да |
Между верхней и нижней строкой таблицы двенадцатикратная разница за один и тот же пятисекундный ролик. Ещё две вещи про то, как читать эти цифры.
Цена на карточке подписана «Генерация видео (длительность 8 сек.)». Это не тариф за ролик, а посекундная ставка, умноженная на восемь. Сходится до копейки на всех проверенных моделях: Hailuo 2.3 даёт 9,63 × 8 = 77,04 при 77,03 на карточке, kling-v3-video 29,70 × 8 = 237,60 ровно столько же. Считать удобнее в секундах.
Версия 1080p везде ровно на 20% дороже, чем 720p. Никаких исключений в каталоге я не нашёл.
Самый дешёвый низ каталога это семейство ltx от Lightricks, от 2,30 ₽ за секунду. Карточки у части этих моделей пустые, вместо описания стоит заглушка «Ботхабчики собирают информацию», поэтому ссылку на них давать не буду, ищите в каталоге по фильтру видео.
Kling V3: дорого, и берут за физику
Начну с неприятного. kling-v3-video стоит 29,70 ₽ за секунду, это вторая цена в каталоге после старшей Veo. Пятисекундный ролик из вашей фотографии обойдётся в 148,50 ₽, и если первый дубль не понравился, второй стоит столько же.
Платят за поведение материи. В описании модели перечислено то, на чём обычно и рассыпается оживление фото: «правдоподобная физика: инерция в движении тела, поведение ткани и жидкостей, естественная мимика». Инерция здесь слово рабочее. Дешёвые модели двигают человека так, будто он собран из картона: голова поворачивается, а плечи стоят. Волосы и одежда выдают подделку быстрее лица.
Режим для фотографии у Kling называется прямо: «оживить фото нейросетью или раскадровку». То есть снимок идёт первым кадром, а не референсом.
Есть версия дешевле, Kling V2.6, 12,38 ₽ за секунду, в два с лишним раза меньше. Режим «изображение-в-видео, когда загруженный кадр приходит в движение» у неё тоже есть, плюс нативный звук и заявленный вывод вплоть до 4K. Если бюджет ограничен, пробовать разумнее с неё, а к третьей версии переходить, когда станет понятно, чего не хватает.
Доступно в BotHub: kling-v3-video.
Hailuo 2.3: сделана ровно под эту задачу
Из всего списка это единственная модель, у которой работа с готовым кадром вынесена в первую строку описания: «видеомодель MiniMax для генерации видео по текстовому описанию или по референсному изображению».
Формулировка про режим оживления у MiniMax точнее, чем у остальных: «движение и сцена достраиваются из готового кадра». Референс держит композицию, стиль и внешность персонажа, и описывать словами, как выглядит человек на фотографии, не нужно. Для старого снимка это важно: чем меньше вы объясняете модели, кого она видит, тем меньше шансов, что она пририсует своё.
Цена 9,63 ₽ за секунду, то есть пятисекундный ролик стоит 48,15 ₽, втрое дешевле Kling V3.
Доступно в BotHub: Hailuo 2.3.
Три Veo, и разница между ними в восемь раз
У Google в каталоге три версии одной модели, и это тот случай, когда перед выбором стоит посмотреть на цену, а не на название.
Версия | ₽ за секунду | Ролик 5 секунд |
Veo 3.1 Lite | 8,84 | 44,20 ₽ |
Veo 3.1 Fast | 26,52 | 132,60 ₽ |
Veo 3.1 | 70,71 | 353,55 ₽ |
Восьмикратная разница между младшей и старшей. При этом звук по тексту карточек есть у всех трёх: у Lite «звуковая дорожка создаётся сразу вместе с видео и синхронизирована с ним», у старшей «синхронный звук», созданный нативно.
Официальная документация Google формулирует набор возможностей так: «Veo 3.1 is a model for generating video with native audio. It supports features like video extension, frame-specific generation, and image-based direction». Последнее, image-based direction, и есть оживление кадра.
Что именно даёт восьмикратная доплата, по карточкам не поймёшь. Обе описаны через 1080p и синхронный звук, разница обозначена только словом Lite. Это как раз тот вопрос, на который отвечает свой прогон, а не пресс-релиз.
Доступно в BotHub: Veo 3.1 Lite, Veo 3.1 Fast, Veo 3.1.
Sora 2: когда на фотографии должны заговорить
Единственная модель в списке, про которую на карточке написано, что она генерирует речь персонажей: «дорожка генерируется вместе с картинкой, включая речь персонажей, шаги, шум улицы и музыкальный фон».
Заявлено, что модель держит многошотовые сцены, несколько планов подряд с одним героем, одной локацией и сохранённым освещением. Для оживления одной фотографии это скорее избыточно, а вот для случая «фотография как первый кадр небольшой сценки» уже нет.
Опорное изображение модель принимает, разрешение заявлено вплоть до 4K. Цена 17,68 ₽ за секунду у обычной версии и 53,04 ₽ у Pro, разница втрое.
Предупрежу заранее: генерация речи по фотографии реального человека это отдельный сюжет с согласием и правами, и к технике он отношения не имеет. Прежде чем заставлять говорить чужое лицо, стоит подумать, чьё оно.
Доступно в BotHub: sora-2 и Sora 2 Pro.
Seedance 2.5: про продолжение, а не про оживление
Модель ByteDance описана как инструмент «для длинных сюжетных роликов, генерации видео по референсам, монтажа и продления сцен». Раздел «Картинка в видео» на карточке есть, но без подробностей, зато отдельно упомянуто управление опорными кадрами и то, что на ней оживляют концепт-арт по референсу.
Читать это стоит так: на одной фотографии её сильные стороны не раскрываются. Брать Seedance имеет смысл, когда кадров несколько и нужна связная сцена, а не пятисекундное движение одного портрета. Цена 18,17 ₽ за секунду.
Доступно в BotHub: Seedance 2.5.
Grok Imagine Video: единственная с внятной длительностью
С этой моделью интересна не цена, хотя 5,89 ₽ за секунду это самая низкая цена в таблице выше, а то, что на её карточке вообще написаны технические пределы. В каталоге есть и версия посвежее, Grok Imagine Video 1.5 за 9,43 ₽ за секунду, её я и гонял.
длительность от 1 до 15 секунд
24 кадра в секунду
480p или 720p
семь соотношений сторон, горизонтальных и вертикальных
три режима: по тексту, из изображения, по референсу
Остальные карточки таких таблиц не содержат, там везде «8 сек., 720p» в прайсе и общие слова в описании. И вот тут вылезает расхождение: лендинг обещает до 10 секунд, прайс на карточках построен на восьми, а Grok заявляет пятнадцать. Кто из них прав, видно в интерфейсе, и об этом следующий раздел.
Доступно в BotHub: Grok Imagine Video.
Что ещё есть в каталоге и почему я туда не веду
В списке видеомоделей лежат kling-v3-motion-control, kling-v2.6-motion-control и ltx-2-retake, то есть перенос движения и пересборка готового ролика. Для фотографии это следующий шаг после оживления, когда движение хочется задать своим примером, а не словами.
Карточки у них пустые. Вместо описания стоит «Ботхабчики собирают информацию», и цена. Вести читателя на такую страницу смысла нет, поэтому ссылок здесь не будет, а модели названы для тех, кто пойдёт искать в каталоге сам. На 17 сентября 2026 года пустыми у видеораздела оказались карточки ltx-2-fast, kling-v3-motion-control и gen3a_turbo, а gen4-turbo отдаёт 404, хотя сама модель в каталоге есть.
Что стоит проверить до первого запуска
Настройки генерации живут за шестерёнкой рядом с полем промпта, и по умолчанию там стоит не то, что вы, скорее всего, ожидаете.
Длительность задаётся ползунком от 3 до 15 секунд, и по умолчанию он стоит на тройке. Мой первый ролик вышел трёхсекундным ровно поэтому. Заодно это ответ на вопрос про десять секунд с лендинга: в интерфейсе потолок пятнадцать.
Режим генерации по умолчанию стоит на «Профессиональном (1080p)», а не на стандартном. Подпись под переключателем честная: «Влияет на качество и стоимость». То есть дефолт у вас дорогой.
Тумблер «Создавайте аудио вместе с видео» тоже включён сразу, и выключать его никто не предлагает.
Последнее поле это мультипромптинг, туда кладётся JSON вида [{"prompt":"...","duration":3},{"prompt":"...","duration":2}]. Ролик разбивается на сцены со своими промптами и длительностью. Для оживления одной фотографии это перебор, а для маленькой сценки уже нет.


Прогон: одна фотография, пять моделей
Обзоры оживления фото обычно делают на витринном материале: закат, кот, девушка с распущенными волосами на ветру. На таком кадре хорошо выглядит всё, потому что ошибку негде заметить. Я собрал обратное.
Исходник сгенерировал в том же BotHub моделью nano-banana-pro за 26,98 ₽: так в кадре оказалось ровно то, на чём модели обычно ломаются, и никого живого я под нейросети не подставил.
Что в кадре и зачем:
руки с видимыми пальцами, мужчина держит раскрытую газету
кириллическая вывеска «ПРОДУКТЫ» и мелкая строка «работаем с 8 до 22»
очки с тонкой металлической оправой
два лица рядом
мелкий геометрический узор на платье

Что писать в промпте
Промпт под оживление фотографии устроен наоборот по сравнению с обычной генерацией видео. Там вы описываете сцену, здесь сцена уже есть, и задача промпта её не сломать. Поэтому в тексте у меня три запрета и ни одного красивого слова: без смены плана, без новых объектов, камера почти неподвижна.
Длинное кинематографичное описание тут работает против вас: чем больше вы рассказываете модели про свет, ракурс и настроение, тем охотнее она перерисует кадр по-своему. Движение стоит называть минимальным и конкретным, вроде «моргают», «газета колышется».
Промпт один на все модели: «Оживи фотографию: лёгкое естественное движение, люди чуть шевелятся и моргают, газета слегка колышется, камера почти неподвижна. Без смены плана и без новых объектов в кадре». Параметры одинаковые: 5 секунд, стандартный режим 720p, аудио включено.
Модель | Сколько ждал | Списано по факту | По прайсу за 5 секунд | Результат |
grok-imagine-video-1.5 | меньше минуты | 14,18 ₽ | 47,15 ₽ | ролик получен |
hailuo-2.3 | около полутора минут | 86,98 ₽ | 48,15 ₽ | ролик получен |
sora-2 | около полутора минут | 106,38 ₽ | 88,40 ₽ | ролик получен |
veo-3.1-fast | меньше минуты | 159,57 ₽ | 132,60 ₽ | ролик получен |
kling-v3-video | около двух минут | 268,14 ₽ | 90,29 ₽ | ролик 3 секунды, 1440×1440 |
Kling я запускал первым, на заводских настройках, то есть 1080p и три секунды. Остальные четыре шли на одинаковых 720p и пяти секундах.
Весь прогон вместе с исходной картинкой обошёлся в 662,23 ₽.
Списание не сходится с посекундной ценой
Вот это главное, что я вынес из прогона.
Берём цену за секунду из каталога, умножаем на пять, раз я просил пять секунд, и сравниваем с тем, что реально ушло со счёта:
Модель | ₽ за секунду | Прайс × 5 | Списано | Разница |
grok-imagine-video-1.5 | 9,43 | 47,15 ₽ | 14,18 ₽ | в 3,3 раза меньше |
hailuo-2.3 | 9,63 | 48,15 ₽ | 86,98 ₽ | в 1,8 раза больше |
sora-2 | 17,68 | 88,40 ₽ | 106,38 ₽ | на 20% больше |
veo-3.1-fast | 26,52 | 132,60 ₽ | 159,57 ₽ | на 20% больше |
Сходства нет ни в одну сторону. А если поделить списание на каталожную цену секунды, выходят множители 1,5 у Grok, 6,0 у Sora и Veo, 9,0 у Hailuo. Пятёрки, которую я заказывал, среди них нет ни у кого.
Отсюда практический вывод: посекундная цена в каталоге это ориентир порядка величины, а не калькулятор. Прежде чем ставить генерацию видео в рабочий процесс с понятной сметой, прогоните один ролик и посмотрите на фактическое списание, оно показывается прямо под ответом.




Сколько ждать
Veo 3.1 Fast и Grok укладываются меньше чем в минуту. Hailuo и Sora просят около полутора. Kling V3 около двух. Для задачи «оживить одну фотографию» это означает, что перебрать три-четыре модели и выбрать лучший дубль реально за один присест, а не за вечер.
Что выбрать под свою задачу
Задача | Что брать | Почему |
Попробовать, не потратив заметных денег | grok-imagine-video-1.5 | в моём прогоне 14,18 ₽ за пять секунд и меньше минуты ожидания |
Оживить старое семейное фото | Hailuo 2.3 | режим сделан под достраивание движения из готового кадра, внешность не надо описывать словами |
Ролик со звуком и репликой | sora-2 | единственная, где на карточке заявлена речь персонажей |
Максимальное качество движения | kling-v3-video | физика тела, ткани и жидкостей, мимика. Готовьтесь платить |
Скорость | Veo 3.1 Fast | быстрее всех в прогоне, при этом со звуком |
Подытожим
Оживление фотографии в 2026 году перестало быть аттракционом и стало строкой расходов. Модели, которые год назад раздавали бесплатно с водяным знаком, сменились платными, и разница в цене между версиями одной и той же модели доходит до восьми раз при неочевидной разнице в результате.
Из этого следуют две практические вещи. Первая: до запуска зайдите в настройки. По умолчанию там три секунды, профессиональный режим и включённый звук, и счёт вы получите именно за такой набор. Вторая: не верьте прайсу на слово. Посекундная цена в каталоге и то, что уходит со счёта, у меня разошлись на всех четырёх моделях, которые я сравнивал честно, и разошлись в обе стороны.
И про выбор модели. Пробовать разумно снизу вверх, потому что на конкретной фотографии дорогая модель не обязательно окажется лучше дешёвой, а стоит ошибка ровно столько, сколько написано в предыдущем абзаце.
Рядом по теме: сколько стоит 25-секундная реклама с ИИ, где на бюджете ролика видно, что генерация видео съедает 88% сметы. И прошлогодний топ нейросетей для анимации картинок, с которым удобно сравнить, как поменялся состав за год.
Каталог моделей, цены и 300 000 токенов новому аккаунту: bothub.ru.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.