Субтитры в прямом эфире: задержка лежит на распознавании, не на видео
Транслировать субтитры в реальном времени значит подхватывать звук, распознавать речь, добавлять пунктуацию и отправлять текст на экран, всё это в доли секунды. Даже заметная задержка видна зрителю и создаёт ощущение, что субтитры отстают от речи. На практике нужно укладываться в очень короткие интервалы.
Это требует особых компромиссов в выборе модели. Нельзя использовать очень большую и точную модель, потому что она работает медленнее. Нельзя ждать, пока человек закончит фразу, чтобы применить контекст для улучшения распознавания. Приходится выбирать меньшие, более быстрые модели и жертвовать некоторой точностью.
Скорость vs качество в прямом эфире
Телевизионные станции решают эту задачу несколькими способами. Часть используют готовые облачные сервисы распознавания речи, которые специально оптимизированы под низкую задержку. Другие держат модели на собственных серверах и управляют задержкой прямо контролируя размер буфера входящего аудио.
Третий вариант — использование стеноаппарата с машинописцем, работающим параллельно с речью. Машинописец слышит говорящего и быстро набирает, система распознаёт его набор и отправляет на экран. Это кажется медленнее, но часто конкурирует по скорости с полностью автоматическим распознаванием.
На практике ни один из методов не даёт идеального результата, поэтому в большинстве крупных трансляций субтитры идут с заметной задержкой, что тоже видно, но телезрители уже привыкли. Достижение полностью синхронных субтитров остаётся целью, а не реальностью.