Синтез голоса научился говорить с нужной громкостью в контексте
Обновленные генеративные модели научились выбирать громкость не по фиксированному значению, а в соответствии с смыслом текста. Заголовки и ключевые фразы произносятся чуть громче, пояснения — тише, вопросы — с нарастающей интонацией и громкостью к концу.
Система анализирует структуру текста, распознаёт списки, цитаты и диалоги, затем генерирует речь с соответствующей динамикой.
Применение в медиа
Подкасты и аудиокниги, озвученные такой моделью, звучат более живо и естественно, чем монотонный синтез предыдущего поколения. Слушатель лучше ориентируется в структуре контента и меньше устаёт от слушания.
Новостные агентства уже используют технологию для автоматической озвучки кратких новостей и брифингов.
Издатели полнометражных аудиокниг пока предпочитают дикторов-людей, но для справочной и учебной литературы синтез становится стандартом.