Голосовой ассистент различает речь пользователя от фонового радио
Улучшение в области обработки речи позволяет голосовым ассистентам надёжнее распознавать команды пользователя в шумной среде. Система применяет спектральный анализ для отделения человеческого голоса от музыки, телевизора и других источников звука.
Данный прорыв особенно важен для использования ассистентов в кухнях, гостиных и офисных помещениях, где фоновый шум постоянен. Уровень ошибок распознавания упал благодаря более точной классификации акустических характеристик.
Механизм разделения источников звука
Нейросеть обучена на миллионах примеров наложенных звуков и может выделить голос пользователя даже при громкости фонового звука, превышающей громкость речи. Алгоритм работает в реальном времени без заметных задержек.
Это позволяет значительно расширить сценарии использования голосовых интерфейсов в домашних условиях и общественных местах. Ложные срабатывания при наличии фонового радио практически исключены.
Производители смарт-устройств уже интегрируют эту технологию в новые поколения ассистентов.