Субтитры в прямом эфире: задержка лежит на распознавании, не на видео

Транслировать субтитры в реальном времени значит подхватывать звук, распознавать речь, добавлять пунктуацию и отправлять текст на экран, всё это в доли секунды. Даже заметная задержка видна зрителю и создаёт ощущение, что субтитры отстают от речи. На практике нужно укладываться в очень короткие интервалы.

Это требует особых компромиссов в выборе модели. Нельзя использовать очень большую и точную модель, потому что она работает медленнее. Нельзя ждать, пока человек закончит фразу, чтобы применить контекст для улучшения распознавания. Приходится выбирать меньшие, более быстрые модели и жертвовать некоторой точностью.

Скорость vs качество в прямом эфире

Телевизионные станции решают эту задачу несколькими способами. Часть используют готовые облачные сервисы распознавания речи, которые специально оптимизированы под низкую задержку. Другие держат модели на собственных серверах и управляют задержкой прямо контролируя размер буфера входящего аудио.

Третий вариант — использование стеноаппарата с машинописцем, работающим параллельно с речью. Машинописец слышит говорящего и быстро набирает, система распознаёт его набор и отправляет на экран. Это кажется медленнее, но часто конкурирует по скорости с полностью автоматическим распознаванием.

На практике ни один из методов не даёт идеального результата, поэтому в большинстве крупных трансляций субтитры идут с заметной задержкой, что тоже видно, но телезрители уже привыкли. Достижение полностью синхронных субтитров остаётся целью, а не реальностью.