Голосовой режим ChatGPT-5 распознаёт речь быстрее за счёт локальной обработки
OpenAI обновила голосовой режим ChatGPT-5, добавив опцию локальной обработки аудиоданных. Вместо передачи записи на удалённые серверы модель теперь распознаёт речь частично на устройстве пользователя, что сокращает задержку между окончанием фразы и началом ответа.
Технически это достигнуто за счёт облегчённой версии модели распознавания, которая работает на процессоре пользователя. Полная обработка всё ещё требует облачных вычислений, но критичная фаза детекции речевых сегментов выполняется локально.
Практический результат
По данным OpenAI, такой подход снижает воспринимаемую задержку на 40–60 миллисекунд в условиях стабильного соединения. Улучшение особенно заметно на слабых сетях, где задержка передачи данных обычно составляет основную часть времени ожидания.
Локальная обработка требует дополнительной оперативной памяти и вычислительных ресурсов на устройстве, поэтому функция доступна не на всех платформах. На смартфонах с ограниченной мощностью пользователи смогут выбрать режим обработки вручную.
Компания планирует расширить локальную обработку на другие функции приложения, включая синтез речи и анализ изображений с голосовым описанием.