Живая речь в озвучке теперь заметнее искусственности в синтезе

По мере совершенствования моделей синтеза речи становятся слышны микротекстуры, которые отличают реальный голос от искусственного. Если ранее синтез скрывал несовершенства общей невыразительностью, то теперь обнажает себя через более тонкие артефакты: лёгкие щелчки на границах фонем, микропаузы в неправильных местах, монотонность вибрато.

Проблема заостряется при использовании синтеза как дополнения к живому голосу в одном медиа-потоке, когда переходы становятся явными.

Подход к сглаживанию различий

Исследователи работают над скрытием синтетических артефактов через добавление контролируемого шума, который маскирует дискретные переходы, и через обучение моделей на более разнообразных акустических окружениях.

Параллельно развивается направление честной маркировки синтетического контента, где звуковой отпечаток делается явным признаком искусственности, а не скрывается.

Баланс между качеством и прозрачностью остаётся открытой задачей для приложений, где синтез используется в сочетании с реальными голосами или в критичных по доверию сценариях.