Оживление статичной картинки стало основным входом в видеогенерацию
Режим, в котором на вход подаётся готовое изображение, а модель достраивает движение, обогнал по частоте использования чистую генерацию из текста. Причина утилитарна: композиция, цвет и внешность персонажа уже зафиксированы, и модели остаётся решить единственную задачу — как всё это будет двигаться.
Пользователи отмечают, что качество результата здесь почти линейно зависит от исходника. Чёткий кадр с понятным передним планом и читаемым фоном оживает аккуратно, а мутная картинка со сложным задником расползается в первые же полсекунды.
Что просить у модели, а что задать кадром
Сложился и рабочий приём описания: движение формулируют отдельно от содержания. Вместо пересказа того, что и так видно на картинке, в запрос кладут только глаголы — куда смещается камера, что поворачивается, что колышется.
Побочный эффект такого разделения — предсказуемость. Один и тот же исходник с разными описаниями движения даёт вариации, которые монтируются друг с другом, потому что цветовая и композиционная база у них общая.
Что это значит
Подробности и первичное описание опубликованы на странице обзор генератора изображений Nano Banana, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Генерация видео нейросетями — он пополняется по мере выхода новых сообщений.