Распознавание русской речи отстаёт от английской на полпроцента
Исследование независимой лаборатории выявило отставание российских моделей распознавания речи от американских на пол процента по метрике WER (Word Error Rate). Разрыв связан с недостаточным объёмом обучающих данных на русском языке и более сложной фонетикой.
Особенно заметна разница при обработке спонтанной речи с фоновыми шумами. На чистом аудио отставание сокращается до 0,2 процента.
Планы по сокращению разрыва
Крупные разработчики обещают увеличить объём русскоязычных данных для переобучения моделей. Ожидается, что в течение года разница упадёт ниже 0,1 процента.
Параллельно ведутся работы по адаптации моделей под региональные акценты и диалекты, что должно улучшить результаты на местном уровне.
Эксперты отмечают, что на практике такое отставание практически незаметно пользователю и не влияет на качество голосовых ассистентов.