Оживление статичной картинки стало основным входом в видеогенерацию

Режим, в котором на вход подаётся готовое изображение, а модель достраивает движение, обогнал по частоте использования чистую генерацию из текста. Причина утилитарна: композиция, цвет и внешность персонажа уже зафиксированы, и модели остаётся решить единственную задачу — как всё это будет двигаться.

Пользователи отмечают, что качество результата здесь почти линейно зависит от исходника. Чёткий кадр с понятным передним планом и читаемым фоном оживает аккуратно, а мутная картинка со сложным задником расползается в первые же полсекунды.

Что просить у модели, а что задать кадром

Сложился и рабочий приём описания: движение формулируют отдельно от содержания. Вместо пересказа того, что и так видно на картинке, в запрос кладут только глаголы — куда смещается камера, что поворачивается, что колышется.

Побочный эффект такого разделения — предсказуемость. Один и тот же исходник с разными описаниями движения даёт вариации, которые монтируются друг с другом, потому что цветовая и композиционная база у них общая.

Что это значит

Подробности и первичное описание опубликованы на странице обзор генератора изображений Nano Banana, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Генерация видео нейросетями — он пополняется по мере выхода новых сообщений.