Границы объектов остаются чёткими даже при сложном движении камеры

Артефакты на границах объектов — размытие, двойные контуры, размазывание деталей — долго оставались признаком синтезированного видео. Особенно заметно это при движении камеры, когда передний план проходит сложную трансформацию относительно фона.

Причина в том, что диффузионные модели работают глобально по кадру, не выделяя границы отдельно. Новый подход использует вспомогательную сеть для предсказания карты краёв, которая затем передаётся основному генератору как жёсткое ограничение.

Технические решения

Карта краёв вычисляется на основе анализа оптического потока между соседними кадрами. Это позволяет нейросети понять, где должны быть резкие переходы, а где плавные градиенты.

Результат особенно заметен в сценах с быстрым панорамированием, где движущиеся объекты теперь сохраняют острые силуэты вместо характерного размытия предыдущих версий.

Улучшение благоприятно влияет на восприятие реалистичности видео и снижает утомляемость при просмотре длительного контента.