Мелкая детализация стала главным критерием оценки генераторов картинок
Разговор о качестве генерации изображений заметно сменил фокус. Крупная форма — поза, композиция, свет — у большинства актуальных моделей выглядит правдоподобно с первой попытки, поэтому сравнивают уже не её, а то, что находится на втором плане и в мелких элементах кадра.
Типичный тест выглядит так: сгенерированную картинку увеличивают до ста процентов и смотрят на украшения, застёжки, плетение ткани, отражения в стекле, дальние окна зданий. Именно там модель чаще всего сваливается в кашу из повторяющихся пятен, которая на превью незаметна, а в печати или на большом экране бросается в глаза сразу.
Почему детали ломаются последними
Механика понятна из устройства диффузии: изображение собирается от общего к частному, и на поздних шагах модель дорисовывает высокочастотную составляющую практически без опоры на смысл сцены. Она знает, что в этом месте должна быть фактура, но не знает, что именно там за объект, — и заполняет площадь статистически правдоподобным шумом.
Практика показывает, что бороться с этим удобнее не увеличением числа шагов, а разделением задачи: сначала общий кадр, потом отдельная переработка проблемного фрагмента с более узким описанием. Локальная генерация по маленькой области даёт модели больше пикселей на тот же объект, и детализация вырастает без изменения композиции.
Побочный эффект такого подхода — рост требований к рабочему процессу. Одиночный запрос перестаёт быть законченной единицей работы, а картинка превращается в несколько последовательных проходов, каждый со своей задачей.
Что это значит
Подробности и первичное описание опубликованы на странице ключевые слова стиля и их влияние на результат, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Нейросети для генерации изображений» — он пополняется по мере выхода новых сообщений.