Синтез голоса научился передавать энергию говорящего за три слова

Система синтеза речи получила способность анализировать энергетические характеристики говорящего всего по трём словам исходного голоса. На основе этого короткого образца модель восстанавливает индивидуальный стиль произнесения, включая темп речи, интенсивность и экспрессивность.

Технологически это достигнуто за счёт улучшения энкодера просодических признаков, который теперь работает с минимальным объёмом данных. Модель использует глубокое обучение для экстраполяции стиля из ограниченного контекста.

Практическое применение

Инновация особенно полезна при работе с голосовыми репликами актёров и публичных фигур, когда нужно озвучить новый текст в характерном для них стиле. Это сокращает время записи и позволяет обойтись без перезаписей.

Система протестирована на выборке из 150 говорящих разного возраста и пола, точность передачи энергии оценена на уровне 91 процента по субъективным и объективным метрикам.

Внедрение в производство планируется в рамках обновления платформ синтеза речи следующего поколения.