Медицинская диктовка: специальный словарь сложнее, чем сам алгоритм

В медицинских кабинетах распознавание речи могло бы ускорить документирование: врач диктует диагноз, модель переводит в текст, готовый к вводу в электронную карту. На практике это работает с трудом, потому что медицинский язык полон терминов, которые обычные модели слышат и пытаются переписать как близкие по звучанию бытовые слова.

Иммунодефицит может быть услышан как иммунодефект, пальпация как пальпирование, а названия лекарств и болезней часто вообще не совпадают ни с чем в обычном словаре модели. Врач диктует эффект, система пишет эффективность. Требуется не коррекция, а переписывание.

Чем медицинская диктовка отличается

Решение очевидно: нужна специализированная модель, обученная на медицинском языке и имеющая словарь медицинских терминов. Но обучение на медицинских данных требует больших объёмов качественных записей, которые либо не публичны, либо дорогие.

Поэтому компании, работающие с медицинской диктовкой, обычно создают гибридные системы: берут базовую модель распознавания, а потом прослаивают сверху специальный модуль, который переписывает выходной текст, заменяя неправильные слова на правильные из медицинского словаря. Это не идеально, но работает.

На практике это означает, что медицинская диктовка осталась нишевой услугой, доступной пока что только в специализированных приложениях для медиков. Общепотребительские инструменты на неё не рассчитаны и обслуживают язык общего назначения.