Сколько стоит 25-секундная реклама с ИИ: считаем бюджет на сценарий, видео, голос и музыку

Кажется, что GenAI сделал производство контента почти бесплатным: открыл ChatGPT — готов сценарий, открыл генератор картинок — есть визуал, добавил видео, голос и музыку — и вот голливудская студия помещается в браузере.
На практике всё сложнее: у каждой нейросети свой интерфейс, тариф, лимиты и представление о задаче. Поэтому я решила посчитать, сколько реально стоит сделать 25-секундный рекламный ролик с помощью ИИ.
Спойлер: 25-секундный ролик обошёлся в 2 126 ₽, или 85 ₽ за секунду. Почти 90% бюджета съела генерация видео — так что ИИ-продакшн не такой равномерно дешёвый, как кажется. А сценарий, озвучка и музыка стоили буквально копейки. Генерила всё через BotHub.
В эксперименте использовались:
● GPT-6 Astra — для сценария и доработки промптов (справится и модель попроще, но почему бы не пощупать новинку);
● Nano Banana 2 — для генерации исходных изображений;
● Kling v3 — для превращения изображений в видео;
● ElevenLabs Flash v3 — для закадровой озвучки;
● Suno v5.5 — для музыкального сопровождения.
О новой v6 писала здесь, на момент эксперимента она еще не вышла, но если вы возьмёте версию новее, глобально ничего не изменится.
Рекламировать решила гербарий. Никаких скрытых интеграций, заказчиков и продуктовых размещений. Просто буквально рекламируем осень. Задача была следующей: создать ролик, используя генеративные модели для сценария, изображений, видео, озвучки и музыки.
Как я считала стоимость ИИ-рекламы и какие инструменты использовала
Сразу оговорюсь: я не учитывала неудачные генерации, чтобы посчитать чистую стоимость результата. На итоговую цену рекламы с ИИ сильно влияют навык промптинга и уровень перфекционизма: чем больше перегенераций, тем выше бюджет.
Если начать учитывать все возможные эксперименты, случайные перегенерации и попытки добиться «атмосферки», стоимость ролика будет расти вместе с уровнем вашего перфекционизма и навыка объяснять, чего вы хотите.
Во время эксперимента я использовала BotHub, потому что так удобнее. Не пришлось постоянно прыгать между отдельными приложениями и вкладками, да и часть задач выполнять дешевле. Ещё есть момент, что так проще посчитать именно стоимость генераций, не только благодаря тому, что сервис отображает, сколько токенов «съест» конкретный промпт.
Себестоимость генерации и стоимость доступа: две разные цифры в ИИ-продакшене
В эксперименте я считала marginal cost — стоимость конкретных генераций, которые вошли в финальный ролик. Для заказчика это не всегда совпадает с реальной стоимостью производства рекламы.
При работе через API или, как я выбрала, через BotHub, можно относительно точно считать стоимость отдельных вызовов: токены, секунды аудио, изображения или видеокредиты. В пользовательских сервисах экономика устроена иначе: подписка даёт определённый объём вычислительного ресурса, а пользователь платит за доступ к нему независимо от того, использовал ли весь лимит.
Поэтому две цифры здесь нужно разделять:
стоимость генерации результата — сколько вычислений потребовал конкретный ролик;
стоимость доступа к инфраструктуре — сколько денег пришлось заплатить, чтобы вообще получить возможность выполнить эти генерации. Для одного ролика вторая величина может оказаться существенно выше первой.
Конечно, всегда можно пойти по пути хардового LLM-щика: найти открытые модели под каждую задачу, скачать веса, развернуть всё локально и почувствовать себя независимым от индустрии. Но для этого желательно иметь компьютер, который способен всё это запускать. Мой ПК, к сожалению, подходит скорее для офиса, а не локального дата-центра. За это спасибо тем же дата-центрам.
ИИ не отменяет профессиональный продакшн
Фотографов, операторов, дикторов и музыкантов не стоит заменять вкладками в браузере. У генеративного контента есть нюансы, особенно в коммерческом использовании: права, лицензии, голоса, стабильность персонажей, контроль результата и требования бренда. И да, ИИ-контент всё ещё довольно легко превращается в нейрослоп, за который вас захейтят. С предисловиями закончили, приступаем.
Шаг 1. Сценарий рекламы с помощью ИИ
Начинать сразу с генерации красивых видео бессмысленно. Сначала нужно понять, что мы рекламируем и что зритель должен увидеть за 25 секунд. Для этого я использовала GPT-6: модель выступила креативным продюсером и сценаристом, а затем помогла разбить ролик на сцены и подготовить промпты.
Первоначальный запрос был примерно таким: дать модели роль креативного продюсера и сценариста, специализирующегося на рекламе, а затем попросить разработать подробный сценарий 25-секундного ролика для гербария. Важное условие — весь контент должен быть создан нейросетями, поэтому сценарий сразу должен учитывать ограничения генерации и содержать промпты для каждого элемента.
Промпт для генерации сценария рекламного ролика
Роль: Ты — опытный креативный продюсер и сценарист, специализирующийся на создании рекламы с помощью нейросетей.
Задача: Разработай детальный сценарий для 25-секундного рекламного ролика для Гербария (альбом с коллекцией засушенных растений/трав).
Важное условие: Весь контент (видео, фото, аудио) будет сгенерирован ИИ. Поэтому твоя задача — дать не просто сценарий с описанием картинки, а сценарий, дополненный промптами для каждого элемента.
Атмосфера: теплая, осенняя, уют
Отдельно пришлось несколько раз возвращаться к модели за мелкими доработками и уточнениями промптов. Это, пожалуй, наиболее реалистичный сценарий использования LLM в подобных задачах: не «один запрос — готовая реклама», а несколько итераций, пока идея не начинает нормально раскладываться на конкретные технические задания.
На сценарную часть и дальнейшие корректировки ушло около 102 рублей.
Шаг 2. Генерация изображений для рекламы: почему image-to-video точнее
Следующая задача — получить изображения, которые станут основой будущих видеосцен. Для этого я использовала Nano Banana 2. Всего для ролика потребовалось восемь базовых изображений. Именно они задавали композицию кадра, атмосферу, освещение, объекты и визуальную стилистику будущего ролика.
Стоимость восьми базовых изображений составила 128,29 рубля. В среднем — около 16 рублей за изображение.
При этом именно на этом этапе особенно хорошо видно значение промпта. Большинство результатов были пригодными, но иногда приходилось не менять модель, а просто точнее объяснить, чего от неё требуется.
Почему image-to-video удобнее для контролируемого продакшна
В этом эксперименте изображение выполняло роль промежуточного состояния между генерацией идеи и генерацией движения. Это важный момент: вместо того чтобы каждый раз генерировать сцену с нуля, мы сначала фиксируем пространственную структуру кадра, а затем просим видеомодель изменить её во времени.
Подробнее про text-to-video и image-to-video
У text-to-video больше степеней свободы: модель одновременно должна интерпретировать описание сцены, выбрать композицию, сформировать объекты и их внешний вид, а затем добавить движение. В image-to-video большая часть этих переменных уже зафиксирована исходным изображением.
Для рекламного ролика это особенно важно. Нам не нужен каждый раз новый красивый кадр — нам нужна последовательность кадров, которые выглядят как части одного продакшна. Исходная картинка становится своеобразным условием для видеомодели: она ограничивает пространство возможных результатов и переносит на следующий этап композицию, объекты, освещение и визуальный стиль. Поэтому в подобных задачах image-to-video — механизм контроля над вариативностью модели.
Самая сложная задача — не сгенерировать красивый кадр, а сохранить состояние сцены
Помимо симпатичной картинки, для ИИ-видео важна согласованность между сценами. Если в одном кадре объект имеет одну форму, положение и освещение, а в следующем модель интерпретирует его уже иначе, зритель быстро замечает артефакт.
Поэтому модель изображений в таком воркфлоу выполняет ещё одну функцию — предварительно фиксирует состояние сцены. Чем больше параметров удаётся задать до передачи изображения в видеомодель, тем меньше переменных остаётся на этапе анимации.
Шаг 3. Генерация видео: самая дорогая часть ИИ-рекламы
Дальше начинается самая дорогая часть эксперимента. Статичные изображения нужно превратить в полноценные видеосцены. Для этого я использовала Kling v3 Video.
Всего было сгенерировано семь видеосцен. На этом этапе модель должна была сохранить исходную композицию и при этом добавить естественную динамику, движение камеры и прочее. Стиль был коммерческий, поэтому обошлись без невероятных переходов и замудрёных промптов.
Генерация видео оказалась самым дорогим этапом. Одна сцена — около 268 ₽, семь — 1 878 ₽.

Почему генерация видео дороже изображения
При генерации изображения модель должна получить один пространственный результат. Для видео необходимо дополнительно обеспечить временную согласованность: объекты должны перемещаться между кадрами непротиворечиво, камера — сохранять заданную траекторию, а освещение и геометрия сцены — не «прыгать» от кадра к кадру.
Для 25-секундного ролика это превращается в большое количество вычислений: даже короткая видеосцена состоит из множества последовательных кадров или латентных представлений, которые нужно согласовать между собой.
Поэтому в текущем ИИ-продакшне видео остаётся вычислительно более дорогим звеном цепочки. В моём эксперименте это напрямую отразилось на экономике: именно генерация видео сформировала подавляющую часть стоимости готового ролика.
Шаг 4. Озвучка рекламы с ElevenLabs: дешево и со вкусом
Когда визуальная часть была готова, ролику понадобился голос. Для озвучки я использовала ElevenLabs. Задача была утилитарной: получить закадровый голос для рекламного ролика. Озвучка обошлась в 6,04 ₽ — один из самых дешёвых этапов.
И это довольно показательный результат. Профессиональная запись голоса обычно требует найти диктора, согласовать текст, выбрать голос, записать материал, получить и проверить результат. В случае с TTS часть этого процесса исчезает. Текст уже есть, голос выбирается в интерфейсе, результат появляется практически сразу.
Это не значит, что ИИ-голос автоматически заменяет профессионального диктора. В коммерческой работе важны права на использование голоса, особенности лицензирования, интонационная управляемость и множество других нюансов. Но для небольшого ролика, прототипа, презентации или тестовой рекламной концепции стоимость в несколько рублей выглядит очень заманчиво и практично.
Почему голос оказался почти бесплатным
TTS в этом пайплайне имеет принципиально другую экономику. На вход модели поступает короткая последовательность текста, а результатом становится аудиопоток. При этом нам не требуется генерировать и согласовывать несколько секунд визуального состояния сцены.
Для нашего сценария это разумный компромисс: нам нужен достаточно естественный закадровый голос с минимальной стоимостью и временем генерации.

Шаг 5. Музыка для рекламы в Suno: бюджет и ограничения
Последний обязательный элемент — музыка. Для неё я использовала Suno v5.5. Она хорошо подходит для таких экспериментов именно потому, что позволяет описывать не конкретную композицию, а её настроение. Вместо работы с нотами можно задать жанр, инструменты, темп, атмосферу и общий характер трека.
Для рекламного продакшна это удобнее, ведь ТЗ: нот нет, нужна немного грустная, немного уютная, но не слишком медленная музыка.
Музыкальная генерация в Suno обошлась в 11,82 ₽. Это ещё один пример, как генеративный ИИ меняет экономику небольших продакшн-задач: музыка для ролика больше не требует поиска стока или заказа оригинального трека. Но полный контроль над результатом не гарантирован.
Сколько стоит ИИ-реклама: таблица расходов
Этап | Инструмент | Стоимость |
Сценарий и промпты | GPT-6 Astra | 102,09 ₽ |
Базовые изображения | Nano Banana 2 | 128,29 ₽ |
Генерация видео | Kling v3 Video | 1 878,17 ₽ |
Озвучка | ElevenLabs Flash | 6,04 ₽ |
Музыка | Suno v5.5 | 11,82 ₽ |
Итого | 2 126,41 ₽ | |
Базовый 25-секундный рекламный ролик, созданный с помощью ИИ, стоит около 2 126 ₽, или 85 ₽ за секунду. Расходы распределились неравномерно: 88% съела генерация видео, сценарий и изображения обошлись дешевле, а музыка и озвучка — буквально несколько рублей.
Вот что у меня вышло:
В этом эксперименте использовались модели, которые можно запускать напрямую. Если покупать доступ к каждому сервису отдельно, расчёт становится менее удобным. Для одного ролика обычно приходится оплачивать не конкретный результат, а месячные подписки или минимальные пакеты кредитов. В моём случае прямые расходы на использованные генерации составили около 2,1 тысячи рублей, сэкономить удалось 1 465 ₽, ведь при работе напрямую пришлось бы оплачивать доступ к нескольким сервисам:
Сервис | Минимальная стоимость |
ChatGPT (Plus) | $20 (~1 729 ₽) |
Nano Banana 2 | ~$0,54 (~47 ₽) |
Kling | $6,99 (~604 ₽) |
ElevenLabs Flash | $6 (~519 ₽) |
Suno | $8 (~692 ₽) |
Итого | ~$41,53 (~3 591 ₽) |
Расчёт по курсу $1 = 86,4 ₽. | |
Тут выводы делаем сами. Прямые тарифы обычно включают гораздо больше кредитов, чем понадобилось именно для этого ролика. Поэтому 3 500 ₽ — скорее стартовый капитал, чем стоимость за один ролик. Но можно и попробовать влезть в бесплатные лимиты или максимально полно использовать оплаченные лимиты. Позвольте мне эту шалость: не просчитывать экономику на десятки юзерских сценариев.
Главная проблема ИИ-продакшена: модели не видят ролик целиком
У каждой модели есть собственное представление о входных и выходных данных. LLM оперирует текстовым контекстом, модель изображений — визуальным представлением, видеомодель — визуально-временным, TTS — речевым, а музыкальная модель — аудиальным. У них нет общего пространства, в котором можно было бы задать: «вот ролик целиком, сохрани его персонажа, стиль, драматургию и синхронизацию между всеми дорожками».
Поэтому связность приходится обеспечивать внешним воркфлоу: промптами, референсными изображениями, ручным монтажом, именованием версий и выбором результатов.
Именно это отличает демонстрацию возможностей отдельных моделей от продакшн-системы. В демо достаточно получить пять впечатляющих результатов. В продакшне эти пять результатов должны ещё и работать вместе. Да, можно сгенерить все и через одну модель, но все мы видели, что чаще всего из этого получается, и слышали фразу «ты клубника, я клубника — как у нас получился банан».
Вот такой эксперимент, делитесь впечатлениями. Если кто-то продаёт гербарии — напишите мне. Ну а если вам зашло, то заходите еще. Больше статей и новостей об ИИ — в нашем блоге.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.