Расшифровка шепота и тихой речи стала возможна в реальном времени

Новая версия системы распознавания речи ChatGPT-5 использует специализированную предварительную обработку аудиосигнала, которая усиливает слабые голосовые частоты без искажений. Модель обучена на расширенном наборе данных, включающем записи шепота, очень тихой и приглушённой речи в различных акустических условиях.

Технология применяет адаптивную фильтрацию и спектральный анализ для выделения речевых признаков из низкоамплитудных сигналов. Точность распознавания шепота повысилась на 34 процента по сравнению с предыдущей версией модели.

Практическое применение

Функция полезна для пользователей в общественных местах, где громкая речь невозможна или нежелательна. Возможность распознавания тихой речи также расширяет доступность системы для людей с заболеваниями голосовых связок.

Система работает в реальном времени с задержкой менее 200 миллисекунд, что обеспечивает комфортное взаимодействие при естественном темпе разговора. Функция доступна во всех голосовых режимах ChatGPT-5 без отдельной настройки.

Полный выход технологии запланирован на все мобильные и десктопные платформы в текущем месяце.