Синтез голоса теперь учится у каждого пользователя его привычки слушания

Статический синтез голоса одинаков для всех пользователей, но люди слушают по-разному: кто-то предпочитает быструю речь, кто-то медленную, одним нужен глубокий голос, другим — высокий и лёгкий. Новая система собирает сигналы о предпочтениях пользователя через взаимодействие с контентом и постепенно адаптирует параметры синтеза.

Модель отслеживает, где слушатель перемещает слайдер громкости, как часто перематывает назад фрагменты аудиокниги, сколько времени проводит с озвучкой относительно письменного текста. Эти сигналы используются как обратная связь для персонализации темпа, интонации и эмоциональной окраски синтезированной речи.

Баланс между персонализацией и приватностью

Система может работать локально на устройстве пользователя, не передавая данные на серверы. Параметры адаптации хранятся в профиле и применяются при воспроизведении любого нового контента, создавая впечатление синтезированного голоса, который говорит точно для этого человека.

Исследования показывают, что персонализированный синтез повышает время, которое пользователь проводит с аудиоконтентом, и снижает утомляемость при длительном прослушивании. Эффект особенно заметен для людей с различными нарушениями слуха и при использовании контента на иностранных языках.

Крупные платформы аудиокниг и подкастов начинают интегрировать эту технологию в свои приложения.