SpaceXAI удвоила точность распознавания речи в новой модели Grok Voice Transcribe 2.0

Опрос
реклама
| Новости Software |
Самое интересное в обзорах
19.09.2026 [12:59],
SpaceXAI выпустила новую модель Grok Voice Transcribe 2.0 для преобразования речи в текст. По заявлению разработчиков, она допускает вдвое меньше ошибок, чем предыдущая версия, при той же стоимости. Модель ориентирована на сложные записи, включая телефонные разговоры с помехами, одновременную речь нескольких людей, а также региональные акценты и диалекты.

Источник изображения: Grok
Grok Voice Transcribe 2.0, как сообщает MarkTechPost, построена на базе аудиомодели, которая используется в Grok Voice. Технология уже ежедневно обрабатывает десятки тысяч звонков в службы поддержки, расшифровывает миллионы часов видеоматериалов и применяется в голосовом ассистенте автомобилей Tesla. Для обучения использовались многоязычные записи с шумами и помехами, после чего модель дополнительно дорабатывалась методами постобучения.
В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 заняла первое место среди 32 потоковых моделей по показателю AA-WER Streaming. Компания также протестировала её на четырёх внутренних наборах данных: телефонных разговорах; диалогах с Grok; произнесённых номерах телефонов, обычных и электронных адресах; коротких фразах для голосовых ассистентов на 19 языках. Во всех четырёх случаях версия 2.0 показала лучшие результаты, чем версия 1.0, однако внутренние данные предоставлены самой SpaceXAI и независимо не подтверждались.
Одним из главных улучшений разработчики называют многоязычное распознавание. Модель автоматически определяет язык, поддерживает десятки языков и способна продолжать расшифровку при смене языка непосредственно во время разговора. На наборе коротких фраз показатель WER, отражающий долю ошибок при распознавании слов, снизился с 20,6 до 6,8 %, то есть примерно на 67 %. Документация также указывает на поддержку автоматического форматирования чисел, денежных сумм и единиц измерения для 25 языков.
Модель доступна через Speech to Text API в пакетном и потоковом режимах. В потоковом режиме поддерживается аудиокодек Opus с потоком данных около 4 Кбайт/с. Для сравнения: несжатый звук в формате PCM с частотой дискретизации 24 кГц требует около 48 Кбайт/с. API поддерживает временные метки и оценки уверенности распознавания каждого слова, разделение речи разных собеседников без дополнительной платы, до восьми аудиоканалов и возможность задать до 100 ключевых терминов. Также предусмотрены автоматическое форматирование чисел и дат, удаление слов-паразитов и определение момента окончания реплики для голосовых ассистентов.
В пакетном режиме можно загружать файлы размером до 500 Мбайт в 12 аудиоформатах, а потоковое распознавание осуществляется через WebSocket. В API модель имеет идентификатор grok-voice-transcribe-2.0. Пакетная расшифровка стоит $0,10 за час аудио, потоковая — $0,20 за час.
Источник:
Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.
