Описания движения оказались важнее подробного описания сцены
Опыт работы с видеомоделями развернул привычку, пришедшую из генерации изображений. Там подробное описание фактуры и света давало прирост качества, здесь избыточный текст скорее мешает.
Модель тратит внимание на перечисление деталей и оставляет меньше на само движение, из-за чего получается красивый, но фактически неподвижный кадр. Пользователи отмечают, что после сокращения описания вдвое движение становится выразительнее.
Один глагол на сцену
Сложилось эмпирическое правило: одна генерация — одно действие. Две попытки уместить в короткий фрагмент несколько последовательных событий обычно дают смазанный переход или полное игнорирование второго события.
Из этого вытекает и способ работы со сложной сценой: её разбивают на отдельные действия и генерируют по фрагменту на каждое. Сборка на монтаже оказывается надёжнее, чем попытка получить всё одной командой.
Что это значит
Подробности и первичное описание опубликованы на странице «разбор Freepik как площадки для генерации», там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Генерация видео нейросетями — он пополняется по мере выхода новых сообщений.