ESPNWrexham suffer heaviest loss under Reynolds, Mac in West Ham routCNN TürkBakan Gürlek duyurdu! Turizmde huzur operasyonları: 106 şüpheli tutuklandıPunchImo LG polls to hold September 26ESPN Deportes¿Dónde se ubica la Hormiga en el futbol griego según su valor?The Jerusalem PostAs his presidency enters its final stretch, Isaac Herzog lays out his three priorities for IsraelInquirerRidon to Sara Duterte: Attend Monday’s Senate impeachment trialDaily MaverickThe invisible border — how 9/11 reshaped global security and identity 25 years laterוואלהרוכב אופנוע כבן 30 נפצע באורח בינוני בתאונה עצמית בכביש 899Bollywood HungamaBREAKING: Daayra marks Kareena Kapoor Khan’s TENTH film to receive ‘A’ rating from CBFC; Kunal Kemmu’s Vibe also gets adult certificateVanguardAtiku’s subsidy plan failed under Obasanjo – PresidencyAnadolu AjansıAntalya'da ambalaj deposunda yangın çıktıIl Fatto QuotidianoSi accascia e perde i sensi durante una partita di padel: paura per Andrea Camplone, ex capitano del Pescara
The Daily Newsstand · Free, Always
Saturday, September 12, 2026

Как озвучить текст с помощью ИИ в 2026 году

Translate

Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и кнопка.

Чтобы попробовать синтез речи, зарегистрируйтесь по реферальной ссылке: на счёт зачисляется 300 000 CAPS, и первые прогоны выходят бесплатными.

Проблема в том, что первый файл почти всегда идёт в мусор.

Не потому, что модель слабая. С моделями как раз всё хорошо: они ставят паузы, тянут интонацию, отличают вопрос от утверждения, а некоторые ещё и принимают текстовую инструкцию вроде «прочитай устало, как будто это пятый созвон за день». Ломается другое. Синтез читает «замок» не в ту сторону, выговаривает «ГОСТ Р 34.10-2012» как «гост эр тридцать четыре точка десять тире две тысячи двенадцать», глотает букву ё и превращает 1 250 000 ₽ в невнятную цепочку цифр. Слушатель спотыкается на первой же ошибке, и дальше уже неважно, какая там была интонация.

Так что дальше по порядку: как готовить текст, чтобы этого не было, какую модель брать под какую задачу, сколько это стоит в рублях и что делать с правами, если аудио уходит в коммерческий проект. В конце сводная таблица по ценам, лимитам и длине куска, который модель проглатывает за один раз.

Что поменялось за последние пару лет

Раньше выбор был короткий: либо робот из читалки, либо живой диктор за деньги и с правками по три дня. Промежуточного не было.

Сейчас промежуточное и есть основной рынок. Главное, что в нём появилось, это управление подачей. Google в демо Text-to-Speech даёт поле Style instructions, куда пишется обычная фраза вроде «read aloud in a neutral newsreader tone», и модель перестраивается. У ElevenLabs тем же занимаются аудиотеги прямо внутри текста. Это уже не ползунки скорости и высоты тона, а режиссура.

Подтянулась скорость. Cartesia Sonic 3.5 отдаёт первый звук примерно за 82 миллисекунды, Deepgram Aura-2 держится ниже 90. Для статьи или подкаста цифры бессмысленные, а для голосового бота это разница между «работает» и неловкой паузой посреди разговора.

С русским стало спокойно: Gemini 3.1 Flash TTS и ElevenLabs v3 заявляют по 70 с лишним языков, и русский там давно не в разделе экзотики.

Не изменилось одно. Модель читает символы, а не мысли автора. Поэтому шаг первый и самый скучный.

Шаг 1. Подготовить текст

Это скучная часть, которую все пропускают, и именно из-за неё потом переделывают запись целиком. Правило простое: всё, что человек достраивает по смыслу, синтезу надо дописать руками.

Ударения и омографы

Русский язык устроен так, что одинаково написанные слова читаются по-разному: за́мок и замо́к, до́рого и дорого́й, у́же и уже́, о́рган и орга́н, бо́льшая и больша́я. Модель выбирает вариант по статистике, а не по вашему контексту, и в половине случаев промахивается.

Лечится двумя способами. Простой: переписать фразу так, чтобы двусмысленности не осталось. «Замок заело» превращается в «дверной замок заело», и вопрос снят. Точный: поставить знак ударения. В Яндексе это плюс перед ударной гласной (зам+ок), в большинстве остальных сервисов работает символ Unicode U+0301 сразу после гласной (замо́к). Второй способ надёжнее, но текст после него нечитаемый глазами, так что держите отдельную версию для озвучки.

Числа, даты и деньги

Число само по себе синтез читает нормально. Проблемы начинаются с падежами и с единицами.

«К 15 марта» модель прочитает как «к пятнадцать марта», потому что в цифрах падежа не видно. «1 250 000 ₽» может выйти как «один миллион двести пятьдесят тысяч рублей», а может рассыпаться на отдельные цифры, если пробелы внутри числа стоят неразрывные или наоборот обычные. «в 2026 г.» превращается в «в две тысячи двадцать шесть г».

Универсальное решение одно: в версии текста для озвучки числа пишутся словами. Дольше, зато предсказуемо. Сама BotHub, кстати, пишет об этом в инструкции к инструменту, и это редкий случай, когда подсказка на лендинге не маркетинговая, а по делу.

Аббревиатуры, латиница и номера стандартов

Тут три разных случая, и путать их не стоит.

Аббревиатуры, которые читаются по буквам (НДС, МФЦ, ФНС), большинство моделей знает. Те, что читаются как слово (ГОСТ, вуз, СНИЛС), тоже обычно проходят. А вот смешанные конструкции ломаются стабильно: «ГОСТ Р 34.10-2012» произносится посимвольно вместе с точками и дефисом. Если такой номер в тексте один, проще написать «гост эр тридцать четыре десять от две тысячи двенадцатого года». Если их двадцать, честнее вынести их за кадр и оставить в тексте на экране.

Латиница внутри русской фразы это отдельная боль. «API вернул 200 OK» модель может прочитать по-английски целиком, может по-русски побуквенно, а может выдать «апи». Здесь помогает транслитерация: «эй-пи-ай вернул двести о-кей». Выглядит дико, звучит правильно.

Римские цифры почти всегда читаются как латинские буквы. «XVI века» это «икс-ви-и века», если не переписать словами.

Буква ё

Без ё «все» и «всё», «небо» и «нёбо», «передохнем» и «передохнём» пишутся одинаково. Модель выбирает частотный вариант. В деловом тексте это почти безопасно, в художественном или в тексте с именами собственными обязательно расставьте ё вручную.

Длина куска

Про это почти нигде не пишут, а на практике оно решает больше, чем выбор голоса.

У каждой модели есть предел текста на один запрос, и он разный в десять раз. У OpenAI tts-1 и tts-1-hd это 4 096 символов. У ElevenLabs Eleven v3 всего 5 000, у Eleven Multilingual v2 10 000, зато у Eleven Flash v2.5 и Eleven Turbo v2.5 уже 40 000.

Почему это важно. Статья на 16 тысяч знаков через tts-1 это четыре отдельных запроса, а значит четыре куска аудио, которые надо сшить. На стыках слышно: модель не помнит, с какой интонацией закончила предыдущий фрагмент, и новый абзац начинается «с нуля». Лечится тем, что резать текст надо не по лимиту символов, а по смысловым границам, по концу абзаца или раздела, и обязательно оставлять в конце куска законченное предложение с точкой. Резать по запятой посреди перечисления нельзя, интонация повиснет.

Если материал длинный и сшивать не хочется, берите модель с большим контекстом, пожертвовав выразительностью.

Шаг 2. Выбрать модель

Тут начинается собственно выбор нейросети для озвучки текста. Разложу по задачам, а не по рейтингу, потому что «лучшая» модель зависит от того, что вы озвучиваете.

OpenAI: tts-1 и tts-1-hd

Рабочая лошадка. Шесть голосов, русский поддерживается, чтение ровное и дикторское, без эмоциональных всплесков. Разница между версиями слышна в наушниках и почти не слышна в динамике телефона: tts-1-hd чище на верхах, tts-1 быстрее и вдвое с лишним дешевле.

Берут её под закадровый голос обучающего ролика, аудиоверсию статьи, озвучку интерфейсных подсказок, туда, где нужна разборчивость, а не актёрская игра. Управлять эмоцией нельзя никак, и лимит на запрос всего 4 096 символов.

Доступно в BotHub: tts-1 и tts-1-hd, оплата в рублях, 1 767,86 ₽ и 4 278,21 ₽ за миллион токенов.

ElevenLabs: v3, Multilingual v2, Flash и Turbo

Лучшее, что сейчас есть по выразительности на русском. Eleven v3 понимает аудиотеги, держит паузы, меняет темп внутри фразы. Multilingual v2 спокойнее и предсказуемее, его чаще берут под длинные ровные тексты. Flash v2.5 и Turbo v2.5 заметно проще по звуку, зато быстрые, дешёвые и глотают 40 000 символов за раз.

Сюда идут подкасты, аудиокниги, реклама, всё, где голос должен звучать как человек, а не как объявление на вокзале.

Ловушка тут не в цене, а в лимите. У самой выразительной Eleven v3 контекст 5 000 символов, в восемь раз меньше, чем у простенькой Flash v2.5. Получается обратная зависимость: чем лучше модель звучит, тем мельче куски, на которые придётся резать текст, и тем больше стыков в готовом файле. Это стоит посчитать до того, как вы пообещали заказчику часовую аудиоверсию.

Доступно в BotHub: шесть моделей ElevenLabs, от Eleven v3 до Eleven Flash v2, плюс клонирование голоса.

Google: Gemini 3.1 Flash TTS и Chirp 3 HD

У Google сейчас две линии. Классические голоса (Standard, WaveNet, Neural2, Chirp 3 HD) продаются по символам: 4 доллара за миллион у Standard и WaveNet, 16 у Neural2, 30 у Chirp 3 HD. Плюс бесплатный месячный лимит, у Standard и WaveNet до 4 миллионов символов, у Chirp 3 HD до одного.

Отдельно идут Gemini TTS, где оплата по токенам и бесплатного лимита нет вообще. Зато там то самое поле Style instructions: пишете «read aloud in a neutral newsreader tone», и модель подстраивается. Голосов в каталоге больше 380 на 75 с лишним языков.

Под что брать: если у вас уже есть проект в Google Cloud и нужен объём. Порог входа высокий: нужен аккаунт, платёжка, зарубежная карта.

Yandex SpeechKit

С 2026 года живёт внутри Yandex AI Studio, старые ссылки на yandex.cloud редиректят туда же. Синтез стоит 1 342 ₽ за миллион символов в первой версии API и 0,1626 ₽ за запрос в третьей, причём запросы длиннее 250 символов считаются кратно. Всё в рублях и с НДС, что для российского юрлица снимает половину вопросов.

Под что брать: голосовые роботы, автоответчики, IVR, всё, что живёт в русскоязычном контуре и должно закрываться закрывающими документами. Отдельно есть Brand Voice, собственный голос компании, но там ценник уже другого порядка: 9 150 ₽ за создание Lite-голоса и от 101 666 ₽ в месяц за хостинг.

Что надо знать заранее: потрогать без регистрации нельзя. Playground требует аккаунт Yandex Cloud и согласие с офертой, я на этом и застрял, когда собирал материал.

Открытые модели

Если данные нельзя отдавать наружу или нужен нулевой ценник на объёме, синтез поднимается локально.

Kokoro 82M под лицензией Apache 2.0 весит 82 миллиона параметров, крутится на процессоре и даёт MOS около 4,5. Русского в её пятнадцати языках нет, так что для наших задач она скорее пример того, каким компактным бывает приличный синтез. Fish Audio S2 Pro на 5 миллиардов параметров и с 80 языками звучит заметно лучше и занимает первую строчку среди открытых, но коммерческое использование по её лицензии платное, это важно прочитать до внедрения. CosyVoice 2 берут за низкую задержку в потоковом режиме.

Под что брать: закрытый контур, персональные данные, большой объём при готовности возиться с инфраструктурой.

Шаг 3. Выбрать голос

В синтезе речи BotHub шесть голосов OpenAI, и на лендинге у каждого есть образец на одном и том же тексте про кофе, что удобно: слышно именно разницу тембров, а не разницу текстов.

Коротко, чем они отличаются на слух:

  • Nova и Shimmer женские, светлые, хорошо ложатся на маркетинг и обучающие материалы

  • Alloy нейтральный, самый «дикторский», под инструкции и документацию

  • Echo мужской ровный, под закадровый текст

  • Fable с мягкой повествовательной интонацией, под истории

  • Onyx низкий мужской, под официальные объявления и трейлеры

Совет, который экономит время: не выбирайте голос по одному примеру с лендинга. Прогоните через два-три голоса свой собственный абзац, тот самый, который пойдёт в работу. Голос, отлично звучащий на рекламе кофе, может развалиться на техническом тексте с числами.

Отдельная история это клонирование. Voice Clone у ElevenLabs делает копию голоса по короткой записи. Технически несложно, юридически минное поле: клонировать чужой голос без письменного согласия нельзя, и «я же просто попробовал» здесь не аргумент.

Шаг 4. Прогнать, послушать, починить

Синтез это не «нажал и готово», а два-три круга правок. Порядок такой.

Первый прогон делайте на коротком куске, абзаца хватит. Слушайте не общее впечатление, а конкретные точки: числа, имена собственные, аббревиатуры, границы предложений. Именно там всё и ломается.

Найденное чините в тексте, а не в настройках. Скорость и высота тона не исправят неправильное ударение.

Второй прогон уже на полном тексте. Здесь ловятся стыки между кусками и общий темп: то, что на абзаце звучало бодро, на двадцати минутах утомляет.

И только потом финальный рендер в нужном формате. В BotHub из интерфейса файл отдаётся в WAV, по API доступны MP3, OPUS, AAC и FLAC. Для подкаста берите MP3 или AAC, для дальнейшего монтажа WAV или FLAC, чтобы не терять качество на пересжатии.

Тест: один текст, три модели

Как будем тестировать

Один и тот же текст на все модели, без адаптации под каждую. Задача не получить красивое аудио, а поймать, где каждая спотыкается. Поэтому текст собран как стресс-тест, 289 знаков:

Восьмого сентября 2026 года ООО «Ёлочка» подписало договор на 1 250 000 ₽ с НДС. Замок на складе заело, и замок XVI века тут ни при чём. Сроки уже сорваны, и это дорогой урок. По ГОСТ Р 34.10-2012 подпись верна, API вернул 200 OK, а модель ElevenLabs v3 прочитала это без запинки. Или нет?

Здесь семь ловушек: падеж в дате прописью, сумма с НДС, буква ё в названии, два «замка» с разным ударением, римские цифры, номер ГОСТа с точками и дефисом, латиница внутри русской фразы. Если будете сравнивать сервисы сами, слушайте именно эти точки, а не общее впечатление. Общее впечатление у всех современных моделей приличное, разваливаются они на частностях.

Тестовый текст вставлен в синтез речи BotHub, выбрана модель tts-1-hd

Тестовый текст вставлен в синтез речи BotHub, выбрана модель tts-1-hd

Голос везде alloy, скорость 1, больше ничего не трогал. Настройки живут за шестерёнкой под полем ввода, там же выбирается любой из шести голосов.

Настройки чата: выбор голоса и скорости

Настройки чата: выбор голоса и скорости

Что вообще доступно

В селекторе моделей есть фильтр «Аудио». Под ним шесть семейств: Gemini, транскрибация, Eleven Labs Voice, генератор музыки Suno, «Генерация голоса» (это модели OpenAI) и клонирование голоса. Внутри Eleven Labs Voice пять моделей, и у каждой в интерфейсе висит человеческое описание, по которому понятно, что брать: eleven-v3 выразительный, eleven-multilingual-v2 с качественной дикцией, eleven-turbo-v2.5 про баланс скорости и качества, две Flash про скорость.

Модели ElevenLabs в интерфейсе BotHub

Модели ElevenLabs в интерфейсе BotHub

В «Генерации голоса» две модели OpenAI: tts-1-hd описана как модель высокого разрешения, tts-1 как базовая.

Модели OpenAI в интерфейсе BotHub

Модели OpenAI в интерфейсе BotHub

Прогон 1. tts-1

Двадцать три секунды аудио, списано 0,76851 ₽. Генерация заняла меньше пяти секунд.

Результат tts-1: 23 секунды, 0,76851 ₽

Результат tts-1: 23 секунды, 0,76851 ₽

Прогон 2. tts-1-hd

Ровно те же двадцать три секунды, списано 1,85998 ₽, то есть в 2,42 раза дороже. Отношение к копейке совпадает с прайсом (4,28 против 1,77), так что разница между версиями честная.

Результат tts-1-hd: 23 секунды, 1,85998 ₽

Результат tts-1-hd: 23 секунды, 1,85998 ₽

Прогон 3. eleven-v3

Тут всё иначе. Генерация шла около двадцати секунд против пяти у OpenAI, аудио вышло на 34 секунды вместо 23, а списано 7,68625 ₽.

Результат eleven-v3: 34 секунды, 7,68625 ₽

Результат eleven-v3: 34 секунды, 7,68625 ₽

Лишние одиннадцать секунд это не баг. eleven-v3 читает медленнее и с паузами, отсюда и естественность. Но если вы считаете бюджет по знакам, помните, что по времени звучания та же самая статья у него выходит в полтора раза длиннее.

Что показал тест

Модель

Длительность

Списано за 289 знаков

₽ за 1000 знаков

Час аудио

tts-1

00:23

0,76851 ₽

2,66 ₽

45 200 знаков, 120 ₽

tts-1-hd

00:23

1,85998 ₽

6,44 ₽

45 200 знаков, 291 ₽

eleven-v3

00:34

7,68625 ₽

26,60 ₽

30 600 знаков, 814 ₽

Два вывода, которые видно только на своём прогоне.

Первый, про пересчёт в часы. Час звучания это примерно 45 тысяч знаков исходного текста на моделях OpenAI и около 30 тысяч на eleven-v3. Десятичасовая аудиокнига обойдётся в 1 200 ₽ через tts-1, в 2 900 ₽ через tts-1-hd и в 8 100 ₽ через eleven-v3. Цифры одного порядка со стоимостью часа работы человека, так что выбирать модель по цене имеет смысл только на действительно больших объёмах.

Второй, про единицы счёта. Тарификация идёт по токенам, а не по символам, и на русском это ощутимая разница. В моём прогоне 289 знаков превратились в 435 токенов, то есть полтора токена на знак. По цене с карточки модели, 1 767,86 ₽ за миллион токенов у tts-1, это 2,66 ₽ за тысячу знаков русского текста вместо 1,77 ₽, которые получаются, если считать знаки. На английском коэффициент будет заметно ниже, там токен ближе к слогу. Практический вывод простой. Прежде чем ставить озвучку на поток, прогоните один пробный запрос своего объёма и посмотрите фактическое списание в интерфейсе. Оно показывается прямо под плеером.

Сколько это стоит

Цены на 8 сентября 2026 года, по официальным тарифам и каталогам сервисов.

Модель или сервис

Цена

Символов за один запрос

Бесплатно

Оплата в рублях

tts-1 в BotHub

1 767,86 ₽ за 1 млн токенов (2,66 ₽ за 1000 знаков)

4 096

пробный доступ

да

tts-1-hd в BotHub

4 278,21 ₽ за 1 млн токенов (6,43 ₽ за 1000 знаков)

4 096

пробный доступ

да

Eleven v3 в BotHub

26,60 ₽ за 1 000 знаков, по замеру выше

5 000

пробный доступ

да

Eleven Multilingual v2 в BotHub

в каталоге 17,53 ₽ за 1 млн токенов

10 000

пробный доступ

да

Eleven Flash v2.5, Turbo v2.5 в BotHub

в каталоге 8,76 ₽ за 1 млн токенов

40 000

пробный доступ

да

OpenAI напрямую

15 $ за 1 млн символов, HD 30 $

4 096

нет

нет

ElevenLabs напрямую

от 6 $ в месяц

зависит от модели

10 000 кредитов в месяц, без коммерческой лицензии

нет

Google Standard, WaveNet

4 $ за 1 млн символов

не ограничен

до 4 млн символов в месяц

нет

Google Chirp 3 HD

30 $ за 1 млн символов

не ограничен

до 1 млн символов в месяц

нет

Google Gemini 3.1 Flash TTS

1 $ за 1 млн текстовых токенов плюс 20 $ за 1 млн аудиотокенов

32 000 токенов

нет

нет

Yandex SpeechKit, API v1

1 342 ₽ за 1 млн символов с НДС

не ограничен

по условиям AI Studio

да

Yandex SpeechKit, API v3

0,1626 ₽ за запрос с НДС

250, дальше кратно

по условиям AI Studio

да

Kokoro 82M, локально

бесплатно, лицензия Apache 2.0

зависит от сборки

полностью

не требуется

Про строки с BotHub нужна оговорка. Цена на карточках моделей стоит за миллион токенов, а не за тысячу знаков, и на русском тексте знак это примерно полтора токена. В скобках я пересчитал в знаки по своему прогону, чтобы строки можно было сравнивать между собой. Там, где прогона не было, стоит цифра из каталога как есть.

Отсюда универсальный совет, который дороже любой таблицы. Посчитайте на своём тексте: вставьте один абзац в синтез речи BotHub, посмотрите списание под плеером, умножьте на объём. Займёт минуту и сэкономит сюрприз на середине проекта.

Права на голос и коммерческая лицензия

Пункт, который пропускают чаще всего, а стоит он дороже всех остальных.

У ElevenLabs на бесплатном тарифе коммерческой лицензии нет. Совсем. Десять тысяч кредитов в месяц выдаются под личное использование, и озвучка рекламного ролика этим тарифом не покрывается. Коммерческая лицензия начинается со Starter за 6 долларов в месяц. Сумма смешная, но узнать про это лучше до публикации, а не после письма от юристов.

У Google и OpenAI платный API изначально предполагает коммерческое использование, отдельной лицензии не требуется, но остаются условия использования конкретной модели, и их стоит прочитать, если вы делаете продукт, а не разовый ролик.

У открытых моделей всё зависит от лицензии. Apache 2.0 у Kokoro разрешает практически всё. Fish Audio Research License у S2 Pro коммерческое использование ограничивает и требует отдельного соглашения. Формулировка «open-weight» не равна «делай что хочешь».

И общее правило поверх всего: синтезированный голос, похожий на голос конкретного человека, это отдельный юридический сюжет, независимо от лицензии на модель.

Что брать под вашу задачу

Если коротко и без «зависит от задачи»:

  • Аудиоверсия статьи или базы знаний. tts-1 или tts-1-hd. Дёшево, разборчиво, эмоции тут не нужны.

  • Подкаст, аудиокнига, реклама. Eleven v3, с оглядкой на лимит в 5 000 символов и на нарезку по абзацам.

  • Длинный текст одним куском. Eleven Flash v2.5 или Turbo v2.5, 40 000 символов за раз.

  • Голосовой бот, IVR, автоответчик. Yandex SpeechKit, если контур русский и нужны закрывающие документы.

  • Закрытый контур или очень большой объём. Открытые модели, с обязательным чтением лицензии.

  • Просто попробовать сегодня, без карты и без VPN. Синтез речи в BotHub, оплата в рублях, модели OpenAI и ElevenLabs в одном окне.

Коротко

Качество синтеза в 2026 году перестало быть узким местом. Узкое место переехало в две вещи: подготовку текста и доступ к оплате.

Первое решается руками за двадцать минут и экономит день переделок. Второе решается выбором площадки.

Про обратную задачу, когда аудио надо превратить в текст, у нас есть отдельный разбор: топ-5 бесплатных нейросетей для транскрибации. А если вам нужен не гайд, а именно сравнение сервисов по качеству звука, загляните в тест пяти бесплатных нейросетей для озвучки: там те же задачи решаются с другой стороны.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.