Как удержать одного персонажа одинаковым в серии сгенерированных кадров

Одиночная картинка давно перестала быть проблемой, а вот серия из десяти кадров с одним и тем же героем — задача другого порядка. Между сценами у персонажа плывёт форма лица, меняется оттенок волос, исчезают и появляются детали одежды, и глаз читает это как разных людей.

Сложность в том, что модель не хранит персонажа как сущность. Каждый запрос она собирает заново из описания, а описание принципиально не способно зафиксировать всё: словами не задать точную ширину переносицы или конкретный оттенок серого в куртке.

Три рабочих подхода

Первый — референс: одно изображение героя подаётся на вход всем последующим генерациям, и модель подтягивает к нему черты. Второй — дообучение небольшого адаптера на нескольких снимках персонажа, после чего он вызывается по имени. Третий, самый дешёвый, — фиксация генератора случайных чисел и предельно подробное, дословно повторяемое описание внешности во всех запросах.

У каждого своя цена. Референс держит лицо, но тянет за собой позу и освещение исходника. Адаптер даёт лучшую стабильность, но требует подготовки и заметно ограничивает диапазон стилей. Фиксация набора параметров бесплатна, но ломается при любом изменении сцены.

В сообществе постепенно оформилась комбинированная схема: адаптер на персонажа плюс референс на конкретную сцену, а расхождения по мелочам — украшениям, шрамам, нашивкам — доводятся локальным редактированием отдельных фрагментов.

Что это значит

Подробности и первичное описание опубликованы на странице как работать с референсным изображением, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Модели и обновления ChatGPT — он пополняется по мере выхода новых сообщений.