Синтез голоса клонирует эмоции из одной записи на текст другого автора
Инженеры разработали механизм диссоциации голосовых параметров, позволяющий отделить эмоциональный контекст от идентификационных признаков. Эмоция извлекается из анализа просодических характеристик — интонации, длительности, интенсивности.
Модель принимает целевой текст, голосовой образец целевого автора и эталонную запись с требуемой эмоцией. На выходе получается речь нужного человека, произносящая нужный текст с эмоциональной окраской исходного образца.
Качество и ограничения
Тестирование показало, что слушатели в 78% случаев оценивают синтезированную речь как естественную и эмоционально адекватную. Система корректно передаёт грусть, радость, энергию и озадаченность.
Разработчики ввели защиту от неавторизованного клонирования: синтез требует явного согласия исходного голосового образца, кодированного в метаданных. Недавние инциденты с поддельными видеообращениями подтолкнули индустрию к такой предосторожности.
Технология уже внедрена в платформы для создания подкастов и озвучки видеоконтента, где актёр может одной фразой установить тональность для целого проекта.