Синтез звука окружения для видео теперь делается параллельно с генерацией
Ранее синтез звукового оформления требовал отдельного этапа после рендеринга видео — сначала создавался визуальный ряд, потом к нему добавлялись звуки окружения. Новый подход позволяет рассчитывать аудио одновременно с генерацией кадров.
Модель анализирует сценарий и визуальное содержимое в реальном времени, предсказывая, какие звуки должны сопровождать каждый момент. Координация между видео и аудио улучшается благодаря единой контекстной базе.
Технические улучшения
Параллельная обработка снижает общее время генерации и позволяет моделям использовать перекрёстные связи между визуальным и звуковым потоками. Качество звука становится адаптивным к деталям видеоряда.
Для создателей контента это означает готовый клип с синхронизированной аудиодорожкой сразу после завершения генерации, без дополнительной обработки.
Подход находит применение в коротких клипах, учебных материалах и рекламе, где звуковое оформление играет ключевую роль в восприятии.