Объекты не растворяются: границы предметов чёткие при любом движении
Проблема размытия границ объектов возникала из-за того, что модели генеративного видео учились минимизировать среднеквадратичную ошибку, что приводило к размытым компромиссным кадрам. Новые архитектуры используют комбинацию потерь: перцептивные функции потерь с акцентом на сохранение краёв, маски объектов и адверсарные тренировки против размывания контуров.
Ключевым улучшением стало внедрение многомасштабной обработки: модель анализирует изображение одновременно на нескольких уровнях детализации, что позволяет отличать значимые границы от шума и сохранять резкость переходов между объектом и фоном.
Механизм сохранения контуров
Алгоритм выделяет семантические границы объектов на основе анализа глубины, оптического потока и информации о материалах поверхностей. Это позволяет модели понимать, где именно должны быть чёткие контуры, и избегать их размытия при движении объекта или камеры.
На практике это особенно заметно при движении тонких объектов, волос, листьев деревьев и других деталей, которые ранее теряли чёткость. Синтезированное видео теперь сохраняет эти элементы с визуальным качеством, близким к исходному материалу.
Технология находит применение в высокочувствительных к качеству контуров сценах: синтез движений персонажей в анимации, визуализация архитектурных проектов, восстановление видеоконтента с недостаточным разрешением.