ESPN DeportesCR7: Pondré fin con Portugal cuando "no aporte"ESPN😡 CFB Bottom 10: NC State had a really bad dayInquirerHighlights: Day 29 of Sara Duterte impeachment trial | Sept. 23, 2026The Jerusalem PostSa’ar rejects claim of global consensus against Israel, says UN majority cannot dictate policyRTP DesportoBenfica exige interdição do Estádio do DragãoDaily MaverickREPORTER’S NOTEBOOK: Estonian echoes — SA’s digital public infrastructure looks like it was made in EstoniaBillboardNumark Drops New Bluetooth DJ Controllers Made for Beginners: Here’s Where to Shop OnlineCBS NewsCo-worker: Gilgo murders suspect unnerved her by tracking her down on a cruiseRai NewsVolley, talia-Finlandia 2-3: azzurri fuoriABC News (Australia)Migrant doctors filling GP gaps where 'there's nobody else'La PresseLes permis d’alcool du T-Rapie Bar suspendus durant 21 joursGlobal NewsMan charged after Durham police say he posted ‘hunting permit’ targeting Muslims
The Daily Newsstand · Free, Always
Wednesday, September 23, 2026

Google выпустила ИИ-модели для синтеза речи Gemini 3.8 Flash TTS, которые умеют клонировать голос

Translate

логотип 3DNews

Опрос

реклама

Новости Software

Самое интересное в обзорах

23.09.2026 [20:55],

Google представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — две новые модели синтеза речи, которые превращают генерацию голоса из набора готовых вариантов в более гибкий инструмент для создания аудио. Модели позволяют создавать собственные голоса, управлять исполнением отдельных реплик и генерировать выразительные диалоги для игр, подкастов, аудиокниг и других проектов.

Источник изображений: Google

Источник изображений: Google

Gemini 3.8 Flash TTS предназначена для создания персонажей и детального управления их голосами. С помощью текстовых запросов можно задать роль, акцент и характеристики голоса более чем для 100 языков и диалектов. В библиотеке также доступно более 2000 готовых голосов, включая региональные варианты мексиканского испанского, квебекского французского и шотландского английского.

Отдельно Google добавила возможность клонирования голоса по 30-секундной аудиозаписи. Функция предназначена для собственного голоса или голоса, на использование которого получено право. Перед созданием копии система проверяет согласие владельца голоса, а полученное аудио защищается водяным знаком SynthID и метаданными C2PA.

После выбора голоса разработчик может управлять каждой репликой отдельно с помощью текстовых указаний. Gemini способна менять темп и характер исполнения, использовать шёпот и другие элементы звуковой подачи, а также добавлять реакции в виде смеха, вздохов и коротких реплик.

Обе модели поддерживают генерацию длинного аудио с сохранением качества, естественного темпа и характеристик голоса на протяжении нескольких часов, а режим двух говорящих позволяет создавать диалоги из одного сценария, сохраняя раздельные голоса и естественную очередность реплик. Gemini 3.8 Flash-Lite TTS при этом рассчитана прежде всего на масштабные проекты, включая дубляж, создание аудиоконтента и голосовых ИИ-агентов.

По данным Google, Gemini 3.8 Flash TTS заняла первое место в бенчмарке Voice Design компании Hume AI с результатом 71,4 балла, а в тесте моделирования акцента получила 60,8 балла. Flash TTS и Flash-Lite TTS также заняли первое и второе места соответственно в метрике Overall Quality Index (также от Hume AI). В слепых оценках пользователей на Voice Arena модели показали высокие результаты в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.

Новые модели доступны с сегодняшнего дня в Google AI Studio, где появился отдельный интерфейс для создания голосовых сценариев. Gemini 3.8 Flash TTS и Flash-Lite TTS также доступны через Gemini API, а их интеграцию анонсировали платформы Agora, LiveKit, Pipecat и Vercel.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.

View the original on 3DNews

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.