Синтез речи различает цитаты и выделяет их интонацией

Система анализирует грамматические маркеры цитат — кавычки, скобки и служебные глаголы — и определяет границы прямой речи. Затем модель синтезирует цитату с отдельным интонационным рисунком, отличающимся от основного повествования.

Цитируемая речь звучит как реплика конкретного персонажа: голос может быть выше, ниже, быстрее или медленнее основного тона. Это делает аудиокниги и подкасты более живыми и понятными.

Повышение читаемости аудио

При озвучке художественных текстов с множеством диалогов слушатель легче отличает речь персонажа от авторских комментариев. Это критично для аудиокниг, где нет визуального разделения на абзацы.

Нейросеть обучена на корпусах профессиональной озвучки и театральной речи. Параметры голоса для цитат подбираются на основе контекста и типа текста — научные работы получают одну интонацию, художественные — другую.