Звук из ничего: синтез фонового шума и эффектов к видео
Раньше звук к видео всегда собирали отдельно или использовали готовые библиотеки. Теперь видеомодели начали синтезировать звук параллельно с видео: если генерируется сцена в офисе, модель может добавить звук офисного шума, гула климатконтроля, звуков печатания.
Проблема в том, что синтезированный звук часто чувствуется как условность. Шумы не совпадают по громкости с видео, не реагируют на видимые события: если в кадре персонаж кладёт предмет, звука падения может вообще не быть или он звучит независимо от того, что на видео.
Где синтез звука работает
Синтезированный звук хорошо справляется с амбиентом, то есть просто фоновым присутствием места. Звук ветра, шум воды, гудение города — это то, что модель генерирует достаточно убедительно и что может звучать вполне натурально на фоне монолога или музыки.
Но звуки действий — щелчки, шаги, падения предметов — лучше добавлять вручную или из библиотек, синхронизируя с видео. Это не требует сложных операций: просто наложение на трек амбиента.
В практике это означает, что звуковой тракт видео теперь часто состоит из трёх слоёв: речь, синтезированный амбиент и эффекты из библиотеки. Это позволяет ускорить продакшен, но требует понимания того, как слои должны работать вместе.