Физика движения выдаёт сгенерированное видео чаще, чем детали
По мере того как разрешение и детализация подтянулись, главным опознавательным признаком генерации стала не картинка, а поведение объектов. Предметы двигаются без веса, ткань не догоняет тело, брошенное не по той дуге падает.
Причина в том, что модель обучена на том, как выглядит движение, а не на том, какими законами оно порождается. Правдоподобный внешний вид кадра не требует правильной инерции, и в спокойных сценах расхождение остаётся незаметным.
Где ошибка становится очевидной
Проваливаются в первую очередь контакты: рука, берущая предмет, ноги, ступающие по земле, столкновение двух объектов. Именно в момент касания видно, что тела не взаимодействуют, а проходят рядом друг с другом.
Практический вывод авторы сделали простой: сцены строят так, чтобы контактов было меньше. Плавное движение, отсутствие манипуляций с предметами и общий план дают заметно больший процент годных дублей, чем крупный план работающих рук.
Что это значит
Подробности и первичное описание опубликованы на странице разбор кейса с портретами политиков, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Генерация видео нейросетями» — он пополняется по мере выхода новых сообщений.