Распознавание речи в живом диалоге отстаёт на одно слово

Анализ временных меток показал, что современные модели распознавания речи, работающие в потоковом режиме, обрабатывают аудиосигнал с задержкой на одно слово (в среднем 0,8–1,2 секунды). Это связано с архитектурой сетей, которые требуют контекста из соседних фрагментов для точного предсказания.

При разговорной скорости около 120 слов в минуту такая задержка становится ощутима и нарушает естественный ритм диалога между человеком и ассистентом.

Попытки решения

Исследователи экспериментируют с усечённым контекстом и предварительной обработкой фонем, чтобы снизить требования к памяти модели. Предварительные результаты показывают возможность сокращения задержки на 25–35 %.

Параллельно развивается подход на основе специализированных чипов с низкой задержкой, которые обещают довести время отклика до уровня 200–300 миллисекунд.

Пока большинство коммерческих решений остаются в диапазоне 800 миллисекунд задержки, что требует от пользователей привыкания к асинхронному взаимодействию.