Синтез голоса воспроизводит вздохи и смешки ведущего
Новое поколение моделей синтеза речи добавило поддержку паралингвистических элементов, включая вздохи, смешки, зевоту и другие звуки, присущие человеческой коммуникации. Система обучалась на размеченных корпусах аудио известных ведущих и тележурналистов, где каждый звук был отмечен вручную.
Синтезированный голос теперь различается по степени усталости, волнения и энтузиазма, что делает озвучку более убедительной для слушателя. Реалистичность повышается на 30 процентов по оценкам фокус-групп, которые часто не отличают синтетическую речь от живой.
Применение в медиа
Технология находит применение в подкастах, видеопроизводстве и интерактивных историях, где робот-ведущий должен звучать живым и естественным. Качество синтеза позволяет использовать эту технику вместо найма человеческого голоса для рутинных проектов.
Издатели экспериментируют с синтезированными голосами знаменитостей и политических деятелей, что вызывает дискуссию о подлинности аудиоконтента и необходимости маркировки синтетического голоса.
Разработчики добавили контроль над интенсивностью естественных звуков, чтобы сбалансировать достоверность и чистоту речи для различных контекстов использования.