Описания движения оказались важнее подробного описания сцены

Опыт работы с видеомоделями развернул привычку, пришедшую из генерации изображений. Там подробное описание фактуры и света давало прирост качества, здесь избыточный текст скорее мешает.

Модель тратит внимание на перечисление деталей и оставляет меньше на само движение, из-за чего получается красивый, но фактически неподвижный кадр. Пользователи отмечают, что после сокращения описания вдвое движение становится выразительнее.

Один глагол на сцену

Сложилось эмпирическое правило: одна генерация — одно действие. Две попытки уместить в короткий фрагмент несколько последовательных событий обычно дают смазанный переход или полное игнорирование второго события.

Из этого вытекает и способ работы со сложной сценой: её разбивают на отдельные действия и генерируют по фрагменту на каждое. Сборка на монтаже оказывается надёжнее, чем попытка получить всё одной командой.

Что это значит

Подробности и первичное описание опубликованы на странице «разбор Freepik как площадки для генерации», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Генерация видео нейросетями — он пополняется по мере выхода новых сообщений.