Расшифровка шепота и тихой речи стала возможна в реальном времени
Новая версия системы распознавания речи ChatGPT-5 использует специализированную предварительную обработку аудиосигнала, которая усиливает слабые голосовые частоты без искажений. Модель обучена на расширенном наборе данных, включающем записи шепота, очень тихой и приглушённой речи в различных акустических условиях.
Технология применяет адаптивную фильтрацию и спектральный анализ для выделения речевых признаков из низкоамплитудных сигналов. Точность распознавания шепота повысилась на 34 процента по сравнению с предыдущей версией модели.
Практическое применение
Функция полезна для пользователей в общественных местах, где громкая речь невозможна или нежелательна. Возможность распознавания тихой речи также расширяет доступность системы для людей с заболеваниями голосовых связок.
Система работает в реальном времени с задержкой менее 200 миллисекунд, что обеспечивает комфортное взаимодействие при естественном темпе разговора. Функция доступна во всех голосовых режимах ChatGPT-5 без отдельной настройки.
Полный выход технологии запланирован на все мобильные и десктопные платформы в текущем месяце.