Синтез речи различает цитаты и выделяет их интонацией
Система анализирует грамматические маркеры цитат — кавычки, скобки и служебные глаголы — и определяет границы прямой речи. Затем модель синтезирует цитату с отдельным интонационным рисунком, отличающимся от основного повествования.
Цитируемая речь звучит как реплика конкретного персонажа: голос может быть выше, ниже, быстрее или медленнее основного тона. Это делает аудиокниги и подкасты более живыми и понятными.
Повышение читаемости аудио
При озвучке художественных текстов с множеством диалогов слушатель легче отличает речь персонажа от авторских комментариев. Это критично для аудиокниг, где нет визуального разделения на абзацы.
Нейросеть обучена на корпусах профессиональной озвучки и театральной речи. Параметры голоса для цитат подбираются на основе контекста и типа текста — научные работы получают одну интонацию, художественные — другую.