Распознавание голоса в телефонной трубке улучшилось в два раза
Модели автоматического распознавания речи, натренированные на аугментированных телефонных данных, достигли эквивалентной частоты ошибок (WER) менее 8% на тестовых наборах, что в два раза ниже, чем у моделей 2024 года. Улучшение вызвано применением техник синтеза канала, которые моделируют деградацию полосы пропускания и дефекты кодека.
Значимый вклад внесла фильтрация шума на входе и контекстное декодирование, которое учитывает специфику телефонных диалогов: сокращения, перебивы, аббревиатуры.
Практические следствия
Внедрение улучшенных моделей в call-центры и системы голосовой верификации снижает число запросов на повтор и повышает качество биометрической аутентификации.
Калибровка под разные телефонные линии и регионы требует специального варианта рантайма, но разница в скорости обработки остаётся в пределах 5% от реального времени.
Откат к устаревшим моделям на производстве уже невозможен: пользователи привыкли к лучшему качеству распознавания и воспринимают любое снижение как технический отказ системы.