Распознавание голоса в телефонной трубке улучшилось в два раза

Модели автоматического распознавания речи, натренированные на аугментированных телефонных данных, достигли эквивалентной частоты ошибок (WER) менее 8% на тестовых наборах, что в два раза ниже, чем у моделей 2024 года. Улучшение вызвано применением техник синтеза канала, которые моделируют деградацию полосы пропускания и дефекты кодека.

Значимый вклад внесла фильтрация шума на входе и контекстное декодирование, которое учитывает специфику телефонных диалогов: сокращения, перебивы, аббревиатуры.

Практические следствия

Внедрение улучшенных моделей в call-центры и системы голосовой верификации снижает число запросов на повтор и повышает качество биометрической аутентификации.

Калибровка под разные телефонные линии и регионы требует специального варианта рантайма, но разница в скорости обработки остаётся в пределах 5% от реального времени.

Откат к устаревшим моделям на производстве уже невозможен: пользователи привыкли к лучшему качеству распознавания и воспринимают любое снижение как технический отказ системы.