Распознавание речи в живом диалоге отстаёт на одно слово
Анализ временных меток показал, что современные модели распознавания речи, работающие в потоковом режиме, обрабатывают аудиосигнал с задержкой на одно слово (в среднем 0,8–1,2 секунды). Это связано с архитектурой сетей, которые требуют контекста из соседних фрагментов для точного предсказания.
При разговорной скорости около 120 слов в минуту такая задержка становится ощутима и нарушает естественный ритм диалога между человеком и ассистентом.
Попытки решения
Исследователи экспериментируют с усечённым контекстом и предварительной обработкой фонем, чтобы снизить требования к памяти модели. Предварительные результаты показывают возможность сокращения задержки на 25–35 %.
Параллельно развивается подход на основе специализированных чипов с низкой задержкой, которые обещают довести время отклика до уровня 200–300 миллисекунд.
Пока большинство коммерческих решений остаются в диапазоне 800 миллисекунд задержки, что требует от пользователей привыкания к асинхронному взаимодействию.