Голосовой ассистент различает речь пользователя от фонового радио

Улучшение в области обработки речи позволяет голосовым ассистентам надёжнее распознавать команды пользователя в шумной среде. Система применяет спектральный анализ для отделения человеческого голоса от музыки, телевизора и других источников звука.

Данный прорыв особенно важен для использования ассистентов в кухнях, гостиных и офисных помещениях, где фоновый шум постоянен. Уровень ошибок распознавания упал благодаря более точной классификации акустических характеристик.

Механизм разделения источников звука

Нейросеть обучена на миллионах примеров наложенных звуков и может выделить голос пользователя даже при громкости фонового звука, превышающей громкость речи. Алгоритм работает в реальном времени без заметных задержек.

Это позволяет значительно расширить сценарии использования голосовых интерфейсов в домашних условиях и общественных местах. Ложные срабатывания при наличии фонового радио практически исключены.

Производители смарт-устройств уже интегрируют эту технологию в новые поколения ассистентов.