Распознавание речи в шуме теперь работает как у профессиональных микрофонов

OpenAI опубликовала отчёт о тестировании речевого движка ChatGPT-5 в условиях высокого уровня фонового шума. При шуме 80 децибел (уровень работающего пылесоса или кафе) точность распознавания составила 94,2 процента, что соответствует показателям профессиональных микрофонных систем шумоподавления.

Достижение стало результатом применения диффузионных моделей для очистки звукового сигнала на входе и адаптивной фильтрации шума в реальном времени. Система отделяет речь от окружающего шума со степенью чистоты, близкой к студийной записи.

Практическое применение

Улучшение особенно важно для голосовых вызовов, диктовки на улице и использования ChatGPT-5 в открытых пространствах с высоким уровнем фонового шума.

Компания протестировала систему на звуковых образцах из 120 различных источников шума: транспорт, строительство, люди, животные, музыка и промышленные звуки.

Функция доступна во всех регионах и платформах, где поддерживается голосовой интерфейс ChatGPT-5, без дополнительных настроек со стороны пользователя.