Голос к видео синтезируется параллельно с рендерингом сцены
Раньше видео и аудио создавались последовательно: сначала рендеривалась сцена, потом к готовому видео добавлялась речь. Это требовало две отдельные очереди обработки и удваивало время ожидания результата.
Новый подход объединил оба процесса в единый конвейер обработки. Видеомодель и система синтеза голоса работают параллельно, обмениваясь минимальной информацией о синхронизации губ и движениях.
Выигрыш в скорости
Время на создание полного видеоматериала сократилось примерно вдвое при тех же вычислительных ресурсах. Это критично для production-сценариев, где требуется быстрая итерация вариантов.
Система автоматически синхронизирует движения рта персонажа со звуковой волной, учитывая фонемы речи в реальном времени.
Параллелизм достигнут без потери качества благодаря предварительной подготовке временных меток и синхронизационных точек.