Распознавание русской речи отстаёт от английской на полпроцента

Исследование независимой лаборатории выявило отставание российских моделей распознавания речи от американских на пол процента по метрике WER (Word Error Rate). Разрыв связан с недостаточным объёмом обучающих данных на русском языке и более сложной фонетикой.

Особенно заметна разница при обработке спонтанной речи с фоновыми шумами. На чистом аудио отставание сокращается до 0,2 процента.

Планы по сокращению разрыва

Крупные разработчики обещают увеличить объём русскоязычных данных для переобучения моделей. Ожидается, что в течение года разница упадёт ниже 0,1 процента.

Параллельно ведутся работы по адаптации моделей под региональные акценты и диалекты, что должно улучшить результаты на местном уровне.

Эксперты отмечают, что на практике такое отставание практически незаметно пользователю и не влияет на качество голосовых ассистентов.