Озвучка текстов на английском и русском теперь неотличима от человека
Обновленный синтезатор речи ChatGPT-5 теперь воспроизводит текст с интонацией, паузами и эмоциональной окраской, неотличимой от записей натурального голоса. Тестирование показало, что слушатели в 94% случаев не могут определить, читает текст человек или модель.
Улучшение достигнуто за счет нового подхода к моделированию просодии и расширения обучающей выборки на разговорных корпусах. Система теперь корректно обрабатывает контекст и расставляет логические ударения в соответствии с семантикой.
Применение в продакшене
Технология используется в аудиокнигах, образовательных материалах и ассистентах для людей с нарушениями зрения. Компании уже адаптируют синтез под фирменные голоса и региональные акценты.
Русскоязычная озвучка учитывает особенности ударения и редукции гласных, что было критично для естественного звучания. Модель корректно работает с аббревиатурами и числами в разных контекстах.
Развертывание в коммерческих продуктах началось с лимитированной группы партнеров; полный доступ ожидается в следующем квартале.