Надписи внутри картинки перестали быть слабым местом генераторов

Ещё недавно любая надпись в сгенерированном изображении означала набор псевдобукв, и её приходилось затирать вручную. Сейчас короткое слово на вывеске, обложке или упаковке модели воспроизводят достаточно уверенно, чтобы результат шёл в работу без правок.

Граница проходит по длине и кеглю. Одно-два слова крупным шрифтом получаются почти всегда, фраза из пяти-шести слов — уже через раз, а мелкий текст в глубине кадра остаётся имитацией текста: правильный ритм строк при полном отсутствии смысла в символах.

Что изменилось внутри

Улучшение связывают с двумя вещами сразу — более сильными текстовыми кодировщиками, которые различают отдельные символы, а не только слова целиком, и обучением на данных, где надписи размечены как отдельная сущность. Модель перестала считать буквы просто текстурой и начала обращаться с ними как с объектом, имеющим форму.

В сообществе устоялся рабочий приём: надпись задают отдельно, кавычками или отдельным полем интерфейса, вместо того чтобы прятать её в общем описании сцены. Так вероятность попасть в нужное написание заметно выше, чем когда текст растворён в длинном предложении.

Тем не менее для макетов, где надпись несёт смысл, а не работает фактурой, разумнее оставлять её на слое поверх картинки. Генерация даёт правдоподобный вид шрифта, но не даёт контроля над кернингом и переносами.

Что это значит

Подробности и первичное описание опубликованы на странице «частые ошибки формулировок», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Промпты и приёмы работы с ИИ — он пополняется по мере выхода новых сообщений.