Голосовой ассистент начал отличать фоновую музыку от голоса
Распознавание речи в шумной обстановке давно остаётся вызовом, особенно когда фоновый звук — это музыка, которая содержит частоты, перекрывающие человеческий голос. Новое поколение моделей разделяет акустический сигнал на компоненты, идентифицируя музыку как стационарный фон и голос как динамическую составляющую.
Подход основан на обучении нейросети различать спектральные характеристики речи и музыки, а также на использовании кратковременной разреженности голоса, который прерывистый по природе. Система достигает точности выделения речи выше 90% даже при громкой фоновой музыке.
Практическое применение
Для пользователей это означает, что голосовые команды срабатывают надёжнее в кафе, офисах с музыкой или при просмотре видео с саундтреком. Ассистенты теперь могут игнорировать музыку, которая звучит из встроенного динамика устройства, и ловить речь пользователя поверх неё.
Разработчики отмечают, что уровень помех всё ещё критичен для качества — в барах с громкой клубной музыкой система работает хуже, чем в офисных кабинетах. Тем не менее, практическая пригодность ассистентов в типовых шумных сценариях заметно выросла.
Функция уже доступна в некоторых версиях коммерческих ассистентов и расширяется по платформам.