Синтезированный голос теперь передаёт авторское ударение в тексте
Системы синтеза научились анализировать контекст и семантику предложений для правильной расстановки ударений. Алгоритм учитывает граммемы слов и их позицию в высказывании.
Раньше синтезированная речь звучала монотонно, с одинаковым интонационным рисунком независимо от содержания. Читатель или слушатель чувствовал отсутствие естественных интонаций.
Применение в аудиокнигах и озвучке контента
Профессиональные сервисы озвучки теперь могут полностью положиться на нейросетевые голоса для создания аудиокниг. Качество синтеза приблизилось к уровню человеческого чтения.
Для издателей это означает возможность автоматизировать массовое создание аудиоверсий текстовых произведений без привлечения актёров. Стоимость озвучки снизилась на порядок, а сроки сократились с недель до часов.
Новая техника также повысила естественность речи в голосовых ассистентах, где каждое предложение требует правильной интонации для понимания пользователем.