ESPNBroncos' striking resemblance to Denver's last Super Bowl winnersPunchNorth Korea women thrash Bangladesh 10-0 in Asian Games openerDaily MaverickReimagining agricultural education as AI transforms farming and future jobsוואלה7 שנות מאסר לסייעת בגן ילדים בנתניה שהורשעה בהתעללות ב-12 פעוטותInquirerMarcos welcomes Imelda acquittal after 40-year graft legal battleRTP DesportoDjokovic fora do top 10 ATP, Zverev ameaça SinnerThe Jerusalem PostIsrael's oldest Holocaust survivor dies at at 107 on Rosh HashanahUOLNo 1º turno, Lula sobe para 42% e Flávio Bolsonaro cai a 37%, mostra pesquisa BTG/NexusColliderOne of the Greatest Sci-Fi Books of the 21st Century Is Under 200 PagesХабрПриз за то, чего вы не сделали: соревнование по кибербезопасности для тех, кто не пишет кодکیهان لندن«توافق دفاعی مکه» موش زائید؟! چشم امید بن‌سلمان به حمایت اسرائیلThe Hollywood Reporter‘Sunday in the Park With George’ Revival Scrapped After Ariana Grande and Jonathan Bailey Exit
The Daily Newsstand · Free, Always
Monday, September 14, 2026

Сколько стоит 25-секундная реклама с ИИ: считаем бюджет на сценарий, видео, голос и музыку

Translate

Кажется, что GenAI сделал производство контента почти бесплатным: открыл ChatGPT — готов сценарий, открыл генератор картинок — есть визуал, добавил видео, голос и музыку — и вот голливудская студия помещается в браузере.

На практике всё сложнее: у каждой нейросети свой интерфейс, тариф, лимиты и представление о задаче. Поэтому я решила посчитать, сколько реально стоит сделать 25-секундный рекламный ролик с помощью ИИ.

Спойлер: 25-секундный ролик обошёлся в 2 126 ₽, или 85 ₽ за секунду. Почти 90% бюджета съела генерация видео — так что ИИ-продакшн не такой равномерно дешёвый, как кажется. А сценарий, озвучка и музыка стоили буквально копейки. Генерила всё через BotHub.

В эксперименте использовались:

GPT-6 Astra — для сценария и доработки промптов (справится и модель попроще, но почему бы не пощупать новинку);

Nano Banana 2 — для генерации исходных изображений;

Kling v3 — для превращения изображений в видео;

ElevenLabs Flash v3 — для закадровой озвучки;

Suno v5.5 — для музыкального сопровождения.
О новой v6 писала здесь, на момент эксперимента она еще не вышла, но если вы возьмёте версию новее, глобально ничего не изменится.

Рекламировать решила гербарий. Никаких скрытых интеграций, заказчиков и продуктовых размещений. Просто буквально рекламируем осень. Задача была следующей: создать ролик, используя генеративные модели для сценария, изображений, видео, озвучки и музыки.

Как я считала стоимость ИИ-рекламы и какие инструменты использовала

Сразу оговорюсь: я не учитывала неудачные генерации, чтобы посчитать чистую стоимость результата. На итоговую цену рекламы с ИИ сильно влияют навык промптинга и уровень перфекционизма: чем больше перегенераций, тем выше бюджет.

Если начать учитывать все возможные эксперименты, случайные перегенерации и попытки добиться «атмосферки», стоимость ролика будет расти вместе с уровнем вашего перфекционизма и навыка объяснять, чего вы хотите.

Во время эксперимента я использовала BotHub, потому что так удобнее. Не пришлось постоянно прыгать между отдельными приложениями и вкладками, да и часть задач выполнять дешевле. Ещё есть момент, что так проще посчитать именно стоимость генераций, не только благодаря тому, что сервис отображает, сколько токенов «съест» конкретный промпт.

Себестоимость генерации и стоимость доступа: две разные цифры в ИИ-продакшене

В эксперименте я считала marginal cost — стоимость конкретных генераций, которые вошли в финальный ролик. Для заказчика это не всегда совпадает с реальной стоимостью производства рекламы.

При работе через API или, как я выбрала, через BotHub, можно относительно точно считать стоимость отдельных вызовов: токены, секунды аудио, изображения или видеокредиты. В пользовательских сервисах экономика устроена иначе: подписка даёт определённый объём вычислительного ресурса, а пользователь платит за доступ к нему независимо от того, использовал ли весь лимит.

Поэтому две цифры здесь нужно разделять:

  • стоимость генерации результата — сколько вычислений потребовал конкретный ролик;

  • стоимость доступа к инфраструктуре — сколько денег пришлось заплатить, чтобы вообще получить возможность выполнить эти генерации. Для одного ролика вторая величина может оказаться существенно выше первой.

Конечно, всегда можно пойти по пути хардового LLM-щика: найти открытые модели под каждую задачу, скачать веса, развернуть всё локально и почувствовать себя независимым от индустрии. Но для этого желательно иметь компьютер, который способен всё это запускать. Мой ПК, к сожалению, подходит скорее для офиса, а не локального дата-центра. За это спасибо тем же дата-центрам.

ИИ не отменяет профессиональный продакшн

Фотографов, операторов, дикторов и музыкантов не стоит заменять вкладками в браузере. У генеративного контента есть нюансы, особенно в коммерческом использовании: права, лицензии, голоса, стабильность персонажей, контроль результата и требования бренда. И да, ИИ-контент всё ещё довольно легко превращается в нейрослоп, за который вас захейтят. С предисловиями закончили, приступаем.

Шаг 1. Сценарий рекламы с помощью ИИ

Начинать сразу с генерации красивых видео бессмысленно. Сначала нужно понять, что мы рекламируем и что зритель должен увидеть за 25 секунд. Для этого я использовала GPT-6: модель выступила креативным продюсером и сценаристом, а затем помогла разбить ролик на сцены и подготовить промпты.

Первоначальный запрос был примерно таким: дать модели роль креативного продюсера и сценариста, специализирующегося на рекламе, а затем попросить разработать подробный сценарий 25-секундного ролика для гербария. Важное условие — весь контент должен быть создан нейросетями, поэтому сценарий сразу должен учитывать ограничения генерации и содержать промпты для каждого элемента.

Промпт для генерации сценария рекламного ролика

Роль: Ты — опытный креативный продюсер и сценарист, специализирующийся на создании рекламы с помощью нейросетей.
Задача: Разработай детальный сценарий для 25-секундного рекламного ролика для Гербария (альбом с коллекцией засушенных растений/трав).
Важное условие: Весь контент (видео, фото, аудио) будет сгенерирован ИИ. Поэтому твоя задача — дать не просто сценарий с описанием картинки, а сценарий, дополненный промптами для каждого элемента.
Атмосфера: теплая, осенняя, уют

Отдельно пришлось несколько раз возвращаться к модели за мелкими доработками и уточнениями промптов. Это, пожалуй, наиболее реалистичный сценарий использования LLM в подобных задачах: не «один запрос — готовая реклама», а несколько итераций, пока идея не начинает нормально раскладываться на конкретные технические задания.

На сценарную часть и дальнейшие корректировки ушло около 102 рублей.

Шаг 2. Генерация изображений для рекламы: почему image-to-video точнее

Следующая задача — получить изображения, которые станут основой будущих видеосцен. Для этого я использовала Nano Banana 2. Всего для ролика потребовалось восемь базовых изображений. Именно они задавали композицию кадра, атмосферу, освещение, объекты и визуальную стилистику будущего ролика.

Стоимость восьми базовых изображений составила 128,29 рубля. В среднем — около 16 рублей за изображение.

При этом именно на этом этапе особенно хорошо видно значение промпта. Большинство результатов были пригодными, но иногда приходилось не менять модель, а просто точнее объяснить, чего от неё требуется.

Почему image-to-video удобнее для контролируемого продакшна

В этом эксперименте изображение выполняло роль промежуточного состояния между генерацией идеи и генерацией движения. Это важный момент: вместо того чтобы каждый раз генерировать сцену с нуля, мы сначала фиксируем пространственную структуру кадра, а затем просим видеомодель изменить её во времени.

Подробнее про text-to-video и image-to-video

У text-to-video больше степеней свободы: модель одновременно должна интерпретировать описание сцены, выбрать композицию, сформировать объекты и их внешний вид, а затем добавить движение. В image-to-video большая часть этих переменных уже зафиксирована исходным изображением.

Для рекламного ролика это особенно важно. Нам не нужен каждый раз новый красивый кадр — нам нужна последовательность кадров, которые выглядят как части одного продакшна. Исходная картинка становится своеобразным условием для видеомодели: она ограничивает пространство возможных результатов и переносит на следующий этап композицию, объекты, освещение и визуальный стиль. Поэтому в подобных задачах image-to-video — механизм контроля над вариативностью модели.

Самая сложная задача — не сгенерировать красивый кадр, а сохранить состояние сцены

Помимо симпатичной картинки, для ИИ-видео важна согласованность между сценами. Если в одном кадре объект имеет одну форму, положение и освещение, а в следующем модель интерпретирует его уже иначе, зритель быстро замечает артефакт.

Поэтому модель изображений в таком воркфлоу выполняет ещё одну функцию — предварительно фиксирует состояние сцены. Чем больше параметров удаётся задать до передачи изображения в видеомодель, тем меньше переменных остаётся на этапе анимации.

Шаг 3. Генерация видео: самая дорогая часть ИИ-рекламы

Дальше начинается самая дорогая часть эксперимента. Статичные изображения нужно превратить в полноценные видеосцены. Для этого я использовала Kling v3 Video.

Всего было сгенерировано семь видеосцен. На этом этапе модель должна была сохранить исходную композицию и при этом добавить естественную динамику, движение камеры и прочее. Стиль был коммерческий, поэтому обошлись без невероятных переходов и замудрёных промптов.

Генерация видео оказалась самым дорогим этапом. Одна сцена — около 268 ₽, семь — 1 878 ₽.

Почти 90% бюджета 25-секундного ролика ушло именно сюда. Сценарий, изображения, музыка и голос на этом фоне стоят копейки. Так что ИИ-реклама — не такая равномерно дешёвая штука, как кажется.

Почти 90% бюджета 25-секундного ролика ушло именно сюда. Сценарий, изображения, музыка и голос на этом фоне стоят копейки. Так что ИИ-реклама — не такая равномерно дешёвая штука, как кажется.

Почему генерация видео дороже изображения

При генерации изображения модель должна получить один пространственный результат. Для видео необходимо дополнительно обеспечить временную согласованность: объекты должны перемещаться между кадрами непротиворечиво, камера — сохранять заданную траекторию, а освещение и геометрия сцены — не «прыгать» от кадра к кадру.

Для 25-секундного ролика это превращается в большое количество вычислений: даже короткая видеосцена состоит из множества последовательных кадров или латентных представлений, которые нужно согласовать между собой.

Поэтому в текущем ИИ-продакшне видео остаётся вычислительно более дорогим звеном цепочки. В моём эксперименте это напрямую отразилось на экономике: именно генерация видео сформировала подавляющую часть стоимости готового ролика.

Шаг 4. Озвучка рекламы с ElevenLabs: дешево и со вкусом

Когда визуальная часть была готова, ролику понадобился голос. Для озвучки я использовала ElevenLabs. Задача была утилитарной: получить закадровый голос для рекламного ролика. Озвучка обошлась в 6,04 ₽ — один из самых дешёвых этапов.

И это довольно показательный результат. Профессиональная запись голоса обычно требует найти диктора, согласовать текст, выбрать голос, записать материал, получить и проверить результат. В случае с TTS часть этого процесса исчезает. Текст уже есть, голос выбирается в интерфейсе, результат появляется практически сразу.

Это не значит, что ИИ-голос автоматически заменяет профессионального диктора. В коммерческой работе важны права на использование голоса, особенности лицензирования, интонационная управляемость и множество других нюансов. Но для небольшого ролика, прототипа, презентации или тестовой рекламной концепции стоимость в несколько рублей выглядит очень заманчиво и практично.

Почему голос оказался почти бесплатным

TTS в этом пайплайне имеет принципиально другую экономику. На вход модели поступает короткая последовательность текста, а результатом становится аудиопоток. При этом нам не требуется генерировать и согласовывать несколько секунд визуального состояния сцены.

Для нашего сценария это разумный компромисс: нам нужен достаточно естественный закадровый голос с минимальной стоимостью и временем генерации.

Мелодию и озвучку сгенерила в одном чате. Для озвучки решила не использовать Suno, так как мне нужен был все-таки диктор, а не пение.

Мелодию и озвучку сгенерила в одном чате. Для озвучки решила не использовать Suno, так как мне нужен был все-таки диктор, а не пение.

Шаг 5. Музыка для рекламы в Suno: бюджет и ограничения

Последний обязательный элемент — музыка. Для неё я использовала Suno v5.5. Она хорошо подходит для таких экспериментов именно потому, что позволяет описывать не конкретную композицию, а её настроение. Вместо работы с нотами можно задать жанр, инструменты, темп, атмосферу и общий характер трека.

Для рекламного продакшна это удобнее, ведь ТЗ: нот нет, нужна немного грустная, немного уютная, но не слишком медленная музыка.

Музыкальная генерация в Suno обошлась в 11,82 ₽. Это ещё один пример, как генеративный ИИ меняет экономику небольших продакшн-задач: музыка для ролика больше не требует поиска стока или заказа оригинального трека. Но полный контроль над результатом не гарантирован.

Сколько стоит ИИ-реклама: таблица расходов

Этап

Инструмент

Стоимость

Сценарий и промпты

GPT-6 Astra

102,09 ₽

Базовые изображения

Nano Banana 2 

128,29 ₽

Генерация видео

Kling v3 Video

1 878,17 ₽

Озвучка

ElevenLabs Flash

6,04 ₽

Музыка

Suno v5.5

11,82 ₽

Итого

2 126,41 ₽

Базовый 25-секундный рекламный ролик, созданный с помощью ИИ, стоит около 2 126 ₽, или 85 ₽ за секунду. Расходы распределились неравномерно: 88% съела генерация видео, сценарий и изображения обошлись дешевле, а музыка и озвучка — буквально несколько рублей.

Вот что у меня вышло:

В этом эксперименте использовались модели, которые можно запускать напрямую. Если покупать доступ к каждому сервису отдельно, расчёт становится менее удобным. Для одного ролика обычно приходится оплачивать не конкретный результат, а месячные подписки или минимальные пакеты кредитов. В моём случае прямые расходы на использованные генерации составили около 2,1 тысячи рублей, сэкономить удалось 1 465 ₽, ведь при работе напрямую пришлось бы оплачивать доступ к нескольким сервисам:

Сервис

Минимальная стоимость

ChatGPT (Plus)

$20 (~1 729 ₽)

Nano Banana 2

~$0,54 (~47 ₽)

Kling

$6,99 (~604 ₽)

ElevenLabs Flash

$6 (~519 ₽)

Suno

$8 (~692 ₽)

Итого

~$41,53 (~3 591 ₽)

Расчёт по курсу $1 = 86,4 ₽.

Тут выводы делаем сами. Прямые тарифы обычно включают гораздо больше кредитов, чем понадобилось именно для этого ролика. Поэтому 3 500 ₽ — скорее стартовый капитал, чем стоимость за один ролик. Но можно и попробовать влезть в бесплатные лимиты или максимально полно использовать оплаченные лимиты. Позвольте мне эту шалость: не просчитывать экономику на десятки юзерских сценариев.

Главная проблема ИИ-продакшена: модели не видят ролик целиком

У каждой модели есть собственное представление о входных и выходных данных. LLM оперирует текстовым контекстом, модель изображений — визуальным представлением, видеомодель — визуально-временным, TTS — речевым, а музыкальная модель — аудиальным. У них нет общего пространства, в котором можно было бы задать: «вот ролик целиком, сохрани его персонажа, стиль, драматургию и синхронизацию между всеми дорожками».

Поэтому связность приходится обеспечивать внешним воркфлоу: промптами, референсными изображениями, ручным монтажом, именованием версий и выбором результатов.

Именно это отличает демонстрацию возможностей отдельных моделей от продакшн-системы. В демо достаточно получить пять впечатляющих результатов. В продакшне эти пять результатов должны ещё и работать вместе. Да, можно сгенерить все и через одну модель, но все мы видели, что чаще всего из этого получается, и слышали фразу «ты клубника, я клубника — как у нас получился банан».

Вот такой эксперимент, делитесь впечатлениями. Если кто-то продаёт гербарии — напишите мне. Ну а если вам зашло, то заходите еще. Больше статей и новостей об ИИ — в нашем блоге.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.