Озвучка чатботов переходит на синтез вместо записанных фраз

Крупные платформы оказались перед техническим переломом: база записанных фраз для озвучки ассистентов растёт экспоненциально, требуя хранилищ в сотни гигабайт и усложняя локализацию. Переход на синтетический голос позволяет сократить размер бинарника интеграции ассистента с 1,2 гигабайта до 180 мегабайт.

Качество синтеза TTS-моделей нового поколения достигло уровня, при котором пользователи не выделяют синтетический голос в беседе длительностью более двух минут. Задержка генерации фонемы упала ниже 50 миллисекунд, что устраняет характерный «робототичный» ритм речи.

Экономия на масштабировании

Переход окупается и для разработчиков: поддержка нового языка теперь занимает две недели вместо трёх месяцев. Не требуется нанимать носителей языка для записи фраз, достаточно дообучить токенайзер на корпусе письменных текстов.

Однако есть сложности. Синтез требует постоянного подключения к облачному API во время работы ассистента, что критично для оффлайн-сценариев. Несколько компаний вкладываются в квантизацию TTS-моделей для устройств пограничных вычислений.

Полный отказ от хранилищ готовых фраз ожидается к середине 2027 года, когда меньшинство платформ завершат миграцию оставшихся языков и диалектов.