Нейросети научились генерировать текст на любом языке без артефактов
Исследователи из Anthropic и Google DeepMind представили технику, позволяющую нейросетям встраивать читаемый текст на любом языке в генерируемые изображения. Ранее генераторы часто создавали размытые, нечитаемые или случайные символы в местах, где предполагалась надпись.
Метод основан на комбинации латентной диффузии и токенизации текста через специализированный энкодер. На этапе обучения модель получает пары изображений и расшифровок текста, что позволяет ей корректно позиционировать и рендерить буквы.
Применение в дизайне
Технология сразу применена в коммерческих генераторах изображений, включая обновлённые версии Midjourney и Stable Diffusion XL. Это упрощает создание постеров, баннеров и упаковки с текстовой информацией без последующей ручной правки.
Поддержка охватывает кириллицу, арабские, иероглифические и другие системы письма. Мультиязычность реализована без потери качества генерации других элементов изображения.
Ограничение сохраняется для очень малых размеров шрифта и плотного расположения текста, однако стандартные задачи дизайна решаются практически без артефактов.