Распознавание речи в документах улучшилось благодаря новой нейросети
Система распознавания речи интегрирована с моделью понимания контекста, которая анализирует жанр, тему и структуру документа еще до начала расшифровки. Это позволяет корректнее интерпретировать омонимы, технические термины и имена собственные.
Нейросеть обучена на миллионах часов аннотированной речи из научных докладов, судебных слушаний, медицинских консультаций и деловых встреч. Вероятность ошибки на специальной лексике снизилась с 12% до 7%.
Практическое применение
Улучшение особенно заметно при обработке медицинских диктовок, где точность жизненно важна. Судебные и нотариальные протоколы теперь готовятся с меньшим количеством ручного редактирования.
Система адаптируется к голосу пользователя за несколько минут, что ускоряет привыкание в корпоративной среде. Фоновый шум подавляется на 35% лучше, чем в предыдущих версиях.
API для разработчиков уже доступен в бета-версии; коммерческая версия запланирована на октябрь.