Звук к сгенерированному видео чаще собирают вручную

Несмотря на появление моделей, генерирующих звук прямо под видеоряд, в реальном производстве дорожку по-прежнему чаще собирают руками. Библиотечные шумы, отдельно синтезированная речь и музыка сводятся в монтажной программе.

Дело в предсказуемости. Автоматически сгенерированный звук нельзя отредактировать по частям: не понравился один удар — придётся перегенерировать всю дорожку и получить другой результат целиком.

Синхронность как узкое место

Вторая сложность — привязка ко времени. Шаг, удар, закрывшаяся дверь должны попадать в конкретный кадр, а модели, работающие по общему описанию сцены, ставят события приблизительно.

Устойчивым остаётся комбинированный подход: атмосферный слой берут у генератора, а всё, что должно попадать в такт изображению, ставят вручную по меткам. Синхронность оказывается ценнее богатства звука.

Что это значит

Подробности и первичное описание опубликованы на странице примеры промптов по восьми категориям, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Генерация видео нейросетями — он пополняется по мере выхода новых сообщений.