Распознавание речи работает при скорости 180 слов в минуту
Нейросетевые модели распознавания научились работать с высокой скоростью речи благодаря архитектурам, обрабатывающим более длинные контексты. Система анализирует фонетические переходы и интонационные паттерны на новом уровне.
Ранее при скорости более 120 слов в минуту качество распознавания падало из-за слияния звуков и затруднённого разделения слов. Новые алгоритмы решили эту проблему за счёт улучшения работы с фонетическим подобием слов.
Значение для профессиональной транскрипции
Стенографисты и судебные писцы могут теперь опираться на автоматическое распознавание речи для ускорения работы. Точность стала достаточной для использования в официальных процедурах.
Учебные заведения получили возможность автоматизировать создание субтитров к лекциям, сохраняя все нюансы речи преподавателей. Студенты с нарушениями слуха получают более полный доступ к контенту.
На телевидении и радио системы могут теперь обрабатывать прямые трансляции с минимальной задержкой, создавая качественные сурдопереводы и субтитры в реальном времени.