Сложные сцены: модель путает, какой признак какому объекту принадлежит
Сцена с одним объектом описывается моделью почти безошибочно. Стоит добавить второй со своим набором признаков — и начинается путаница: цвета меняются местами, материал одного предмета переходит на другой, количество перестаёт соблюдаться.
Явление известно как утечка признаков. Текстовое описание сжимается в набор чисел, где связь «этот цвет относится к этому предмету» выражена слабо, а близко стоящие в предложении слова влияют друг на друга сильнее, чем логика фразы.
Счёт и пространство
Рядом лежат две смежные слабости. Числительные соблюдаются приблизительно: просьба нарисовать пять предметов регулярно даёт четыре или шесть, причём чем больше число, тем хуже. Пространственные отношения — слева, за, под — соблюдаются немногим лучше подбрасывания монеты, если в кадре больше двух объектов.
Обходные приёмы в сообществе устоялись: описывать сцену короткими независимыми блоками, генерировать сложную композицию по частям и собирать её отдельными правками, задавать расположение не словами, а схемой на входе.
Улучшения приходят вместе с более сильными текстовыми кодировщиками, которые сохраняют синтаксическую структуру фразы, а не только набор упомянутых понятий. Разрыв между простыми и многообъектными сценами сокращается, но пока остаётся заметным.
Что это значит
Подробности и первичное описание опубликованы на странице разбор двух генераторов изображений, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Модели и обновления ChatGPT» — он пополняется по мере выхода новых сообщений.