Звук к сгенерированному видео чаще собирают вручную
Несмотря на появление моделей, генерирующих звук прямо под видеоряд, в реальном производстве дорожку по-прежнему чаще собирают руками. Библиотечные шумы, отдельно синтезированная речь и музыка сводятся в монтажной программе.
Дело в предсказуемости. Автоматически сгенерированный звук нельзя отредактировать по частям: не понравился один удар — придётся перегенерировать всю дорожку и получить другой результат целиком.
Синхронность как узкое место
Вторая сложность — привязка ко времени. Шаг, удар, закрывшаяся дверь должны попадать в конкретный кадр, а модели, работающие по общему описанию сцены, ставят события приблизительно.
Устойчивым остаётся комбинированный подход: атмосферный слой берут у генератора, а всё, что должно попадать в такт изображению, ставят вручную по меткам. Синхронность оказывается ценнее богатства звука.
Что это значит
Подробности и первичное описание опубликованы на странице примеры промптов по восьми категориям, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Генерация видео нейросетями — он пополняется по мере выхода новых сообщений.