Синтез голоса научился говорить с нужной громкостью в контексте

Обновленные генеративные модели научились выбирать громкость не по фиксированному значению, а в соответствии с смыслом текста. Заголовки и ключевые фразы произносятся чуть громче, пояснения — тише, вопросы — с нарастающей интонацией и громкостью к концу.

Система анализирует структуру текста, распознаёт списки, цитаты и диалоги, затем генерирует речь с соответствующей динамикой.

Применение в медиа

Подкасты и аудиокниги, озвученные такой моделью, звучат более живо и естественно, чем монотонный синтез предыдущего поколения. Слушатель лучше ориентируется в структуре контента и меньше устаёт от слушания.

Новостные агентства уже используют технологию для автоматической озвучки кратких новостей и брифингов.

Издатели полнометражных аудиокниг пока предпочитают дикторов-людей, но для справочной и учебной литературы синтез становится стандартом.