Физика движения выдаёт сгенерированное видео чаще, чем детали

По мере того как разрешение и детализация подтянулись, главным опознавательным признаком генерации стала не картинка, а поведение объектов. Предметы двигаются без веса, ткань не догоняет тело, брошенное не по той дуге падает.

Причина в том, что модель обучена на том, как выглядит движение, а не на том, какими законами оно порождается. Правдоподобный внешний вид кадра не требует правильной инерции, и в спокойных сценах расхождение остаётся незаметным.

Где ошибка становится очевидной

Проваливаются в первую очередь контакты: рука, берущая предмет, ноги, ступающие по земле, столкновение двух объектов. Именно в момент касания видно, что тела не взаимодействуют, а проходят рядом друг с другом.

Практический вывод авторы сделали простой: сцены строят так, чтобы контактов было меньше. Плавное движение, отсутствие манипуляций с предметами и общий план дают заметно больший процент годных дублей, чем крупный план работающих рук.

Что это значит

Подробности и первичное описание опубликованы на странице разбор кейса с портретами политиков, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе «Генерация видео нейросетями» — он пополняется по мере выхода новых сообщений.