Контекст в голосовом режиме: память ассистента ограничена

В текстовом чате вся история видна на экране, и ассистент может ссылаться на то, что было сказано десять сообщений назад. В голосовом режиме слова звучат, но не остаются визуально, и пользователь вынужден повторять информацию.

Разработчики начали записывать голосовые диалоги и преобразовывать их в текст, чтобы система могла держать контекст, как в обычном чате. Но это добавляет задержку и требует обработки больших объёмов.

Память, которая слышит

Ещё одна трудность: в голосовом разговоре легче забыть детали, потому что голос не индексируется так же, как текст. Поиск по фразе, которая звучала полчаса назад, требует прослушивания всей записи.

Системы начинают выделять ключевые моменты и их индексировать. Результат похож на автоматическое создание заметок к разговору, но это ещё не совершенно: система может пропустить важное.

Суть проблемы в том, что голосовой интерфейс естественнее, но менее структурирован, чем текстовый. Контекст приходится восстанавливать через технику, а не полагаться на видимую историю.