Объём звука. Как устроена акустика интеллектуальной колонки СберБум 2.0

Меня зовут Маркос, я руковожу разработкой аппаратной части устройств Сбер, в том числе интеллектуальных колонок. Особенно их — я более двадцати лет занимаюсь исследованиями и разработкой в области электроакустики (включая разработку линеек активной концертной акустики одного из мировых лидеров индустрии).
В новом поколении колонок мы поставили себе задачу дать её владельцам уникальный пользовательский опыт и выстроить свой фирменный звук. Так появилась мощная стационарная колонка СберБум 2.0. Устройство премиум-класса, звучащее как Hi-Fi начального уровня.
Сегодня расскажу об акустике колонки: почему у неё не семь динамиков, какой диапазон частот ключевой для стереоэффекта и чем наш пользовательский эквалайзер отличается от других.
Внутри колонки
Разработка устройства, особенно с нуля, начинается с вольной инженерной мысли: что бы эдакого создать? Поэтому мы закупились образцами разных динамических головок от разных вендоров и начали увлечённо исследовать возможные варианты акустического оформления в разных размерах и конфигурациях. Делали предварительное моделирование, печатали корпуса и производили необходимые измерения на профессиональных аудио стендах. Тестировали как простые фазоинверторные двухполосные системы, так и более экзотические варианты — например, трёхполосную цилиндрическую систему мощностью 150Вт с семью динамиками (колонка получилась бы просто огромной!).
В результате поисков появилось десять макетов.

По результатам прослушиваний и данным UX-исследований стало понятно, что интеллектуальная колонка: 1. По большей части играет в фоновом режиме. 2. Стоит не в центре помещения, а на полке или столешнице у стены. Отсюда главные требования к ней:
Хорошо отрабатывать низкие частоты с 50 Гц на малой громкости и при этом не напрягать слушателя.
Показывать максимально ровную АЧХ во всём диапазоне звуковых частот с диапазоном звука от 50 Гц до 20 кГц (как-никак это премиум-класс с задатками Hi-Fi).
Обладать направленным стереозвуком с оптимальной дисперсией, позволяющей создать чёткую сцену с приемлемой стереобазой.
Хорошо слышать пользователя во всех рабочих режимах — даже когда воспроизводит очень энергичную музыку на полной громкости.
Разумеется, быть мощнее первого поколения СберБум.
Вооружившись всеми этими идеями (местами противоречивыми с инженерной точки зрения) начали работу с целевым дизайном. Из всех собранных прототипов двухполосный 2.1 с двумя пассивными радиаторами лучше всего показал себя в пределах продуктовых требований.

В выборе динамиков мы учитывали, что для стереозвука нужны минимум два — причём акустически изолированных друг от друга, чтобы исключить взаимное влияние. Если использовать два широкополосных динамика, играющих весь звуковой диапазон, придётся добавить в каждый из отсеков фазоинвертор/пассивный радиатор. При этом ни один широкополосный динамик приемлемого размера не способен ровно отработать диапазон от 50 Гц до 20 кГц. А стереосцена, как правило, начинается примерно от 300 Гц и выше. Она опирается на то, что в мастеринге треков паннинг, то есть панорамирование инструментов, делают в области средних частот — скрипок, саксофона, даже вокала — и лишь в очень редких случаях в области низких. Получается, что основной диапазон, который нужно развести в стерео — среднечастотный.
Так в СберБум 2.0 появился большой мощный низкочастотный динамик, который играет до 450 Гц, и два специально разработанных широкополосных динамика для частот с 450 Гц до 20 кГц. Они расположены в изолированных закрытых камерах, чтобы избежать интермодуляции, под определённым углом, обеспечивая оптимальную направленность и дисперсию. Это позволило:
существенно снизить коэффициент нелинейных искажений (КНИ) на высокой громкости;
почти полностью избавиться от интермодуляционных искажений, когда одна частота, преимущественно более низкая, «модулирует» более высокую. Человеческий слух воспринимает это как хрипы и дрожь в вокале и инструментах в такт басам и ударным.
Получить хорошую стереосцену и панораму при прослушивании на разных расстояниях — в том числе непосредственно перед колонкой, даже с минимальной физической стереобазой. Это как раз даёт специально подобранный угол между динамиками и конструкция акустической системы.
Максимально изолировать от прямого излучения микрофонную матрицу и улучшить качество срабатывания споттерного слова.
Интересный факт: правильно расположить колонки для наилучшего звука помогает её механический дизайн. Интуитивно пользователь ставит её корректно — вперёд LED-экраном, назад кабелем питания. А значит, динамиками к себе.
Акустический дизайн готов. Началась ещё более интересная часть работы – тонкая настройка!
Лучший звук, какого можно добиться
Наша амбиция — узнаваемое звучание, как у многих брендов акустики. Такое, чтобы опытный слушатель мог даже в слепом прослушивании узнать устройство Сбер. Вместе с тем, исходя из задачи интеллектуальной колонки, её звук должен быть универсальным и консистентным, отрабатывать на каждом треке (включая любую дичь) и покрывать все возможные хотелки пользователя по части акустики.
Для обработки звука СберБум 2.0 используется наша собственная библиотека Salute Sound Processing (SSP). Она реализует часть функций, которые мы не готовы поручать встроенным алгоритмам или сторонним библиотекам (которые придётся подключать через несколько слоёв адаптации), чтобы не потерять в качестве и/или производительности. В СберБум 2.0 библиотека SSP разделяет потоки под каждый из усилителей колонки — один низкочастотный и два среднечастотных. Далее на уровне DSP усилитель почастотно разделит эти потоки. Кроме того, на библиотеке SSP реализованы две важные функции колонки:
Room correction
Способность колонки подстраиваться под особенности акустического окружения — конкретного помещения — а также изменение этого окружения. Обычное устройство, когда запускают Room Correction, включает специальный тестовый сигнал (громкий и довольно неприятный). В СберБум 2.0 коррекция бесшовна: когда колонку переставляют во время воспроизведения трека, через 10-20 секунд она адаптируется к окружению.
Коррекция разбита на две части:
детектор. Он в фоне, пока играет музыка, оценивает акустическое окружение и определяет его параметры;
алгоритм, который по этим параметрам выравнивает звучание устройства.
Мы уместили коррекцию в диапазон регулировок 2-3 децибел — согласно исследованиям, именно в этих границах она не искажает звучание, а только улучшает.
Пользовательский эквалайзер
Именно с его интерфейсом человек взаимодействует в мобильном приложении. Перед тем, как разрабатывать своё решение, мы посмотрели на рыночную практику. Оказалось, что каноничный вариант — взять воспринимаемый человеком диапазон частот от 20 Гц до 20 кГц и разделить на равные участки, далее каждая полоса контролирует свой участок. Но в таком варианте эквалайзер регулирует и те частоты, которые колонки уже не играют. Мы же разработали для СберБум 2.0 функциональный пользовательский эквалайзер, который регулирует частоты выше 200 Гц и до 7,4 кГц. Используя его, слушатель заметит разницу в настройках.

Кроме того, с нашей точки зрения должна быть разница в том, как именно регулируются крайние частоты, верхняя и нижняя. Среднестатистический вариант — поднять или опустить эту полосу частот резонансно. Мы сделали для нижней и верхней полос фильтры другого типа, не резонансные, а шелф-фильтры: они регулируют их равносильно. Это позволяет не потерять регулировку всех частот во всём (слышимом) диапазоне. Благодаря тому, что библиотека SSP — на уровне системы, пользовательский эквалайзер работает с любым потоком аудио, в том числе передаваемым на колонку по bluetooth.
В СберБум 2.0 используются продвинутые цифровые усилители со встроенным DSP (Digital Signal Processor — цифровой процессор сигналов). Он позволяет почти полностью освободить от задач базовой обработки звука основную систему и SoC. Основные элементы DSP — это входной микшер-коммутатор; основной набор биквадратных фильтров, или EQ; регулятор уровня; динамический EQ с низкочастотным и высокочастотным блоками; трёхполосный компрессор (DRC); автоматический ограничитель (AGC); четырёхполосный параметрический выходной EQ; выходной микшер-коммутатор; блок управления накачкой заряда выходного каскада (который используется только для низкочастотного канала).
На уровне DSP реализованы следующие блоки:
Предварительное нормирование
Чтобы уровень сигнала был в оптимальных для дальнейшей обработки пределах.
Кроссовер и рутинг
Разделяем частоты поканально для более чистого звука и точной сцены.
Динамический EQ, то есть автоматическая тон-компенсация
Она опирается на особенности человеческого слуха, чтобы обеспечить комфортное прослушивание на любом уровне громкости. Если уменьшить громкость, колонка плавно приподнимает уровень низких частот, чтобы не было эффекта «а где басы?». На высокой громкости немного снижает уровень высоких частот, компенсируя эту разницу для уха.
DRC (Dynamic Range Control)
Автоматическое сжатие динамического диапазона при очень высоком уровне сигнала. Громкость не переходит безопасные уровни для железа благодаря тонкой настройке. Dynamic Range Control реализован на DSP усилителя.
Ограничение и защита
Защищаем динамики и выходной каскад усилителя от выхода из строя, программно обозначив параметры пиковой выходной мощности в DSP.
Колонка, которая слышит имя
Обеспечить способность ИИ-помощника слышать и отвечать пользователю на любой громкости — это всегда технический челлендж, с которым нужно работать одновременно на хардверном и софтверном уровнях.
Например, на микрофонную матрицу наверху должна минимально влиять работа акустического чембера. (Источник звука и микрофон в одном корпусе — это всегда головная боль). Основные критерии расположения микрофонов — это:
их расположение в регулярной структуре. Это одномерная или двумерная сетка либо окружность с равным шагом;
определённый диапазон шага сетки, который определили по результатам эксперимента.
Кстати, по итогам опытов увеличить количество микрофонов не значит «улучшить распознавание звука с микрофона»: это больше обработки, при этом выигрыш по подавлению шумов может быть незначительным.
В итоге в СберБум 2.0 используется квадратная матрица из четырёх микрофонов на расстоянии 71 мм по диагонали. Чтобы обеспечить приемлемое для работы алгоритмов VQE отношение сигнал/шум, мы расположили микрофоны в другой плоскости, изолировав от области прямого излучения динамика, плюс провели тщательную акустическую изоляцию.
На микрофонах не должно быть акустического давления выше 95 Дб в виде звука от самой колонки. Уровень акустического давления на всех частотах и громкостях зависит от общей настройки цепочки DSP. Нам нужно всегда быть в допуске по максимальному давлению в области микрофонов, поэтому DSP настраивали с расчётом не допускать превышения предельных значений в динамике — условно, следить за уровнем сигнала в нужном диапазоне частот и при необходимости максимально незаметно «подрезать» его.
Метрика, которой мы измеряем способность колонки услышать пользователя — это FRR: false rejection rate, доля запросов, которые устройство пропустило. Рассказывали больше об этой метрике и её экспериментальной оценке здесь. Мы также проводим эмпирическую оценку FRR на тестовом стенде: управляющий ПК + аудиокарта + прецизионная студийная колонка, которая будет воспроизводить записанные голосовые команды. Уровни голосовых команд с измерительными приборами калибруем с измерительными приборами так, чтобы он соответствовал громкости реального человеческого голоса.
Тестируемая колонка стоит на определённом расстоянии от прецизионной. Для теста берём трек потяжелее — наизусть выучили The End of the Line от Metallica. Фрагмент трека проигрываем десять раз, каждый раз увеличивая громкость на 10% с помощью скрипта, и так до 100%. Параллельно запускаем голосовые команды. При каждом повышении автоматически фиксируем, сработал ли споттер. Тест повторяется до десяти прогонов — среднее значение FRR становится итоговым.
Со стороны софта для оптимизации FRR необходимо настроить DRC — Dynamic Range Control — и динамический EQ. Именно они влияют на итоговое соотношение сигнал/шум в цепи захвата голоса пользователя и в конечном итоге — на FRR. Чтобы дополнительно компенсировать влияние неизбежно существующих резонансов в акустической системе, необходима также тонкая настройка на уровне основного EQ.
Заключение
При разработке СберБум 2.0 мы расширили границу задачи: сделать не умную колонку, способную вдобавок к умным функциям исполнить трек, а полноценное музыкальное устройство, которое захочется слушать. Новая колонка достигает показателей хорошей полочной акустики начального Hi-Fi уровня. Не хочу хвастаться (немного хочу), но она способна дать позитивный опыт прослушивания даже искушённому меломану.
При этом задача СберБум 2.0 — консистентно отыгрывать любой трек и нравиться большинству пользователей. Разумеется, на восприятие будет влиять психоакустика — субъективное восприятие звука; найдётся кто-то, кто заявит: «Ерунда, переделывайте». Нам же нужен звук, услышав который, пользователь скажет: «О, это мне подходит. Это — колонка для меня».
В подготовке статьи участвовали
Александр Кудинов, Михаил Чуриков
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.