Алло, это робот: почему голосовые системы телефонии могут быть лучше, чем кажется на первый взгляд

Отношение к ИИ в поддержке, мягко говоря, неоднозначное — компании активно используют голосовых ассистентов несмотря на то, что клиенты чаще всего не в восторге от таких «помощников». Поговорим, почему роботу на другом конце провода стоит дать шанс и на каких задачах голосовые системы ИИ могут проявить себя с лучшей стороны — в том числе, за счет новых фреймворков для разработки интеллектуальных систем телефонии. Также делимся подборкой открытых инструментов для создания мультимодальных голосовых агентов.
Роботов действительно не любит никто, кроме бизнеса?
В конце прошлого года аналитики из исследовательского подразделения Qualtrics оценили, насколько эффективны системы ИИ в поддержке с точки зрения качества обслуживания. Эксперты опросили более 20 тыс. респондентов из 14 стран, включая США, Великобританию, Францию и Германию. Оказалось, что почти каждый пятый из обратившихся к ИИ-помощникам в клиентском сервисе не сумел получить ответ на свой вопрос или решить проблему.
Результат вполне ожидаемый — в данной сфере чат-боты и голосовые помощники играют лишь роль интерактивного FAQ. Шаг влево или вправо, и приходится звать оператора-человека, достучаться до которого — порой та еще задача. Бывает, что системы ИИ выдают неточную информацию или даже дезинформируют, а разбираться с последствиями приходится клиенту. Яркий пример — история Air Canada, когда бот авиакомпании выдумал несуществующее правило и пообещал пассажиру скидку.
Что касается мотивов бизнеса к внедрению ИИ-операторов, то они прозаичны — при всех своих недостатках роботы позволяют сократить операционные расходы. В прошлом году в Salesforce заменили 4 тыс. сотрудников поддержки ИИ-агентами. По словам директора компании Марка Бениоффа, такой шаг уменьшил расходы на кол-центры на 17%. Теперь около 50% обращений клиентов компании обрабатывают нейросети: «И я не считаю это сценарием из антиутопии, для меня это — реальность».
В 2023 году шведский финтех Klarna тоже передал работу семисот операторов поддержки новой системе ИИ. Правда, в их случае подобная операция вряд ли окупилась. За полгода качество обслуживания в части поддержки упало настолько, что компании пришлось подключать для общения с клиентами сотрудников из смежных отделов — инженеров, дизайнеров и маркетологов, чтобы хоть как-то исправить ситуацию. В 2025 году финтех вновь стал набирать специалистов в техподдержку, а директор компании переменил точку зрения: «Важно, чтобы клиент ясно понимал: если он захочет, у него всегда будет возможность пообщаться с живым сотрудником».
Впрочем, есть вероятность, что в недалеком будущем директор Klarna снова передумает: ИИ-системы в данной области не стоят на месте.
Агенты против предубеждений
По некоторым оценкам, голосовые системы ИИ обрабатывают до 19% входящих звонков в контактных центрах — против 6% в 2024 году. В целом неудивительно, учитывая, что за последние год-два разработки продвинулись вперед. Вот пара последних их достижений:
Работают в «шумных» условиях. Современные голосовые ИИ-системы способны распознавать речь на фоне дорожного шума, региональных акцентов, перебиваний со стороны клиентов и разговоров окружающих. Для этого используются технологии фильтрации шума и специально обученные языковые модели. Например, такую систему продолжает внедрять американская сеть быстрого питания Taco Bell — сейчас она работает почти в 900 ресторанах. Голосовые агенты помогают принимать заказы у автомобилистов, учитывая меню конкретной точки, наличие ингредиентов и заготовок, а также временные специальные предложения. Технология уже показывает положительные результаты. В 2025 году компания Intouch Insight провела проверку силами тайных покупателей: они оценили 120 заказов с участием ИИ в трех сетях фастфуда (включая Taco Bell). Такие заказы выполнялись в среднем на 21 секунду быстрее. При этом 97% участников проверки остались довольны обслуживанием с ИИ.
Хотя и без курьезов в этой сфере не обходится. В прошлом году один из водителей попытался заказать в «драйв-тру» ресторана «восемнадцать тысяч стаканов воды», и система зависла. Голосовые ИИ-ассистенты не лучшим образом обрабатывают нестандартные ситуации, однако подобные сценарии постепенно закрываются с помощью более строгих правил эскалации.
Подстраиваются под меняющиеся условия. Ранние голосовые ИИ-системы представляли собой FAQ-сервисы: распознавали запрос и формировали ответ, ориентируясь на ограниченный набор информации. Теперь развиваются более сложные решения, построенные как «созвездия» специализированных моделей, каждая из которых отвечает за отдельную часть взаимодействия с пользователем. Примером может быть американская Hippocratic AI, которая разрабатывает голосовых ИИ-агентов для взаимодействия с пациентами. В основе системы не один универсальный агент, а группа моделей: одна ведет разговор с пациентом, а другие контролируют ее работу, в том числе проверяют точность медицинской информации. Специальный оркестратор координирует их работу: определяет, какой агент должен подключиться к разговору, в какой момент и с какой задачей, учитывая контекст беседы и реакцию пациента. Такая архитектура используется в разных сценариях — от профилактики повторных госпитализаций до сопровождения людей с хроническими заболеваниями.
Новые решения в сфере голосовых ИИ-ассистентов постепенно уменьшают то, что специалисты из Уортонской школы бизнеса еще в 2015 году назвали algorithm aversion — это феномен, отражающий склонность людей не доверять прогнозам и решениям компьютерных систем, даже если они справляются не хуже человека. В расчете на то, чтобы со временем победить этот эффект, разработчики развивают новые аудиомодели для проектирования голосовых интерфейсов. Например, в этом году OpenAI представили GPT-Realtime-2 и GPT-Realtime-Translate, способные вести диалог, обрабатывать запросы пользователей и переводить речь с более чем семидесяти языков (и отвечать на тринадцати из них). Что интересно, open source-сообщество тоже старается не отставать. Независимые разработчики предлагают немало любопытных проектов в сфере ИИ-телефонии.
VideoSDK AI Agents
Python-фреймворк под лицензией Apache 2.0 для мультимодальных голосовых агентов. Фреймворк управляет поведением агента на протяжении разговора: обрабатывает входящее аудио, определяет момент, когда собеседник закончил реплику (turn detection), отслеживает голосовую активность и реагирует на перебивание. Пайплайн можно собрать под свою задачу, используя разнообразные компоненты: модули распознавания (STT) и синтеза речи (TTS), детектор голосовой активности (VAD) и детектор смены говорящего, языковую модель и проч.
В отдельном репозитории под лицензией MIT можно найти пошаговое руководство по сборке ИИ-агента для телефонии — с приемом входящих и совершением исходящих звонков через SIP. В нем собраны все нужные компоненты со ссылками на них, для части шагов приведены примеры кода, а работа в интерфейсе показана на GIF-анимациях. Если интересны подробности, можно ознакомиться со справочником по SDK, а также документацией.
Pipecat
Еще один Python-фреймворк для сборки мультимодальных ИИ-агентов, работающих в режиме реального времени. Первая версия инструмента вышла в 2024 году под лицензией BSD-2-Clause. На сегодняшний день его репозиторий на GitHub собрал свыше 13 тыс. звезд.
Pipecat выступает оркестратором мультиагентных систем, которые в рамках проекта взаимодействуют через общую шину сообщений. На официальном сайте представлено интерактивное демо, позволяющее оценить работу пайплайна в связке с разными компонентами при обработке речи. К примеру, можно взять комбинацию Soniox + OpenAI + Cartesia и построить на их основе голосовую систему (она поддерживает и русский язык).
Также разработчики подготовили множество примеров голосовых приложений: от простого чат-бота до ИИ-рассказчика и игры про угадывание слов. Гайд по написанию собственного ИИ-агента можно также найти в документации. В ней же имеется глава с примерами кода и инструкциями — как добавить и реализовать ту или иную возможность конкретной командой.

AgentLine
Это — платформа для телефонии, которая позволяет ИИ-агентам получить телефонный номер и совершать голосовые звонки (а также получать и читать SMS). Развивает AgentLine одноименный стартап. Код проекта опубликован на GitHub под лицензией MIT в 2026 году.
Схема звонка выглядит следующим образом. Вызов принимает подключенный провайдер — например, SignalWire — и передает аудио в AgentLine. Платформа проигрывает приветствие, записывает речь и преобразует ее в текст, чтобы отправить расшифровку на указанный вебхук. Далее, ИИ-агент изучает присланный фрагмент, формирует ответ и возвращает его в AgentLine для передачи собеседнику. У AgentLine есть встроенный биллинг, а также «почтовый ящик» событий, работающий по модели опроса (polling). На сайте проекта собраны различные руководства — в том числе разбор того, какие приложения можно построить на платформе. Подробнее об устройстве, компонентах и установке можно почитать в документации.
Благодаря этим и другим решениям ИИ-агенты становятся все более самостоятельными и лучше справляются с реальными сценариями общения. Однако даже самые продвинутые модели не работают в вакууме: качество их взаимодействия с пользователем по-прежнему зависит от телекоммуникационной инфраструктуры, через которую проходит звонок. За разговором с ИИ-агентом скрывается целый набор технологий, отвечающих за установление соединения, передачу данных и безопасность коммуникации. Одна из таких технологий — ePDG (Evolved Packet Data Gateway). Она используется для подключения устройств к ядру мобильной сети через сторонние Wi-Fi-сети и является важным элементом инфраструктуры Wi-Fi Calling. Для пользователя это означает более надежную связь в местах, где мобильный сигнал слабый или отсутствует, например, внутри зданий и на парковках.
Еще больше материалов в нашем корпоративном блоге и на Хабре:
Как мы развернули собственный стенд мобильного оператора для тестирования ядра сети. Проверять работоспособность новых компонентов или функций удобнее в тестовой среде, максимально приближенной к реальным условиям эксплуатации. В этом материале рассказали о разработке собственной лаборатории — какие компоненты использовали в стенде на основе EPC/CUPS-архитектуры Еще поделились нашими сценариями тестирования и обсудили возможные препятствия и ограничения.
Как оператору масштабироваться без перестройки сети. Рассказываем о том, как с помощью нашей платформы провайдеры могут адаптировать свою сетевую инфраструктуру под возрастающую нагрузку. Обсуждаем метод кластерного масштабирования, архитектуру с NPB-балансировщиками и несколькими DPI-узлами.
MVNO: от первых проектов 90-х до современных бизнес-моделей. Виртуальные операторы появились не спонтанно, а как результат мер по развитию рынка телекомов. Если к концу девяностых виртуальных операторов было немного, единицы в отдельных странах, то за следующие двадцать лет в мире их стало больше двух тысяч. В статье расскажем, как зародилась концепция MVNO в девяностых, какие препятствия пришлось преодолеть российским виртуальным операторам и как рынок выглядит сегодня.
«Ловит даже на парковке»: что происходит в сфере VoWiFi. Рынок товаров и услуг, связанных с технологией VoWiFi, активно растет — эксперты предполагают, что за 2026 год он увеличится почти в два раза. А независимые разработчики и фанаты движения DIY видят в VoWiFi основу для интересных проектов в области связи. Поговорим о том, как технология более чем двадцатилетней давности обрела новый виток популярности.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.