Синтез голоса воспроизводит вздохи и смешки ведущего

Новое поколение моделей синтеза речи добавило поддержку паралингвистических элементов, включая вздохи, смешки, зевоту и другие звуки, присущие человеческой коммуникации. Система обучалась на размеченных корпусах аудио известных ведущих и тележурналистов, где каждый звук был отмечен вручную.

Синтезированный голос теперь различается по степени усталости, волнения и энтузиазма, что делает озвучку более убедительной для слушателя. Реалистичность повышается на 30 процентов по оценкам фокус-групп, которые часто не отличают синтетическую речь от живой.

Применение в медиа

Технология находит применение в подкастах, видеопроизводстве и интерактивных историях, где робот-ведущий должен звучать живым и естественным. Качество синтеза позволяет использовать эту технику вместо найма человеческого голоса для рутинных проектов.

Издатели экспериментируют с синтезированными голосами знаменитостей и политических деятелей, что вызывает дискуссию о подлинности аудиоконтента и необходимости маркировки синтетического голоса.

Разработчики добавили контроль над интенсивностью естественных звуков, чтобы сбалансировать достоверность и чистоту речи для различных контекстов использования.