Референс на входе генератора: где проходит граница между стилем и копией

Подача картинки на вход вместе с описанием давно перестала быть экзотикой: так задают композицию, палитру, манеру исполнения. Управляет этим один параметр — насколько сильно исходник влияет на результат.

На практике ползунок ведёт себя нелинейно. В нижней трети диапазона референс почти не считывается, в верхней результат превращается в слегка перекрашенный оригинал, а всё интересное умещается в узкую полосу посередине, границы которой у каждой модели свои.

Что именно перенимается

Отдельная сложность — референс переносит не то, что ожидает пользователь. Задумывая перенос манеры рисунка, человек получает вместе с ней композицию и позу; желая повторить композицию, тянет за собой палитру. Разделить эти составляющие одним числом невозможно.

Ответом стали раздельные каналы влияния: отдельно контур и глубина сцены, отдельно поза фигуры, отдельно цветовая гамма, отдельно стиль. Каждый со своим весом, и вместо одного ползунка пользователь получает несколько независимых, что заметно повышает предсказуемость.

Обратная сторона — усложнение интерфейса и необходимость понимать, какой именно канал отвечает за нужный аспект. Пользователи отмечают, что без этого понимания раздельные веса дают результат хуже, чем один общий ползунок.

Что это значит

Подробности и первичное описание опубликованы на странице разбор результатов на публичных лидербордах, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе «Нейросети для генерации изображений» — он пополняется по мере выхода новых сообщений.