Синтез голоса клонирует эмоции из одной записи на текст другого автора

Инженеры разработали механизм диссоциации голосовых параметров, позволяющий отделить эмоциональный контекст от идентификационных признаков. Эмоция извлекается из анализа просодических характеристик — интонации, длительности, интенсивности.

Модель принимает целевой текст, голосовой образец целевого автора и эталонную запись с требуемой эмоцией. На выходе получается речь нужного человека, произносящая нужный текст с эмоциональной окраской исходного образца.

Качество и ограничения

Тестирование показало, что слушатели в 78% случаев оценивают синтезированную речь как естественную и эмоционально адекватную. Система корректно передаёт грусть, радость, энергию и озадаченность.

Разработчики ввели защиту от неавторизованного клонирования: синтез требует явного согласия исходного голосового образца, кодированного в метаданных. Недавние инциденты с поддельными видеообращениями подтолкнули индустрию к такой предосторожности.

Технология уже внедрена в платформы для создания подкастов и озвучки видеоконтента, где актёр может одной фразой установить тональность для целого проекта.