Звук шагов, дыхание, фон: синтез всех слоёв за одну команду
Ранее при генерации видео звук приходилось добавлять отдельно или вручную подбирать из библиотек. Новая версия Sora создаёт синхронный звуковой трек, который соответствует движениям на экране: шаги совпадают с ударами ног, дыхание — с грудной клеткой актёра, окружающий звук отражает среду.
Интеграция аудио и видео в один вывод упрощает конвейер создания контента. Звукодизайнеры не тратят часы на синхронизацию, а режиссёры сразу получают готовый к использованию материал.
Качество синтеза
Синтетический звук пока не идеален: на шумных фонах алгоритм иногда теряет ясность отдельных слоёв, а редкие звуки может перепутать. Но для большинства сценариев результат приемлем на первый просмотр.
Это ускоряет прототипирование видеоконтента. Студии могут быстро смонтировать черновик с полным звуком и показать клиентам, вместо того чтобы ждать работы сурдооператора.
На рынке это создаёт давление на профессионалов звука, чьи услуги становятся избыточными для массового контента. Профильные студии переходят на редактирование и исправление автоматического синтеза, а не на создание с нуля.