Растворение объектов при движении перестало быть признаком подделки

Видеомодели научились сохранять консистентность объектов на протяжении всего видеоклипа, устраняя эффект их растворения или магического исчезновения при смещении камеры. Новый механизм пространственной памяти отслеживает всех объектов и их позиции в трёхмерной сцене.

Растворение предметов на краях кадра или при быстром движении было классическим признаком синтезированного видео. Это происходило потому, что нейросеть теряла информацию о положении объектов в пространстве.

Трёхмерное отслеживание при синтезе

Разработчики внедрили метод неявного отслеживания объектов через глубинные карты и векторные поля движения. Это позволяет системе понимать трёхмерную геометрию сцены и предсказывать, где окажутся объекты вне текущего видимого кадра.

Результат заметен в длительных панах камеры, сложных переходах между плоскостями и сценах с множеством движущихся предметов. Видео выглядит физически логичным и последовательным.

Улучшение значительно затруднит выявление синтезированного видео по этому признаку и повысит реалистичность контента в развлекательных и профессиональных применениях.