Нейросети научились генерировать текст на любом языке без артефактов

Исследователи из Anthropic и Google DeepMind представили технику, позволяющую нейросетям встраивать читаемый текст на любом языке в генерируемые изображения. Ранее генераторы часто создавали размытые, нечитаемые или случайные символы в местах, где предполагалась надпись.

Метод основан на комбинации латентной диффузии и токенизации текста через специализированный энкодер. На этапе обучения модель получает пары изображений и расшифровок текста, что позволяет ей корректно позиционировать и рендерить буквы.

Применение в дизайне

Технология сразу применена в коммерческих генераторах изображений, включая обновлённые версии Midjourney и Stable Diffusion XL. Это упрощает создание постеров, баннеров и упаковки с текстовой информацией без последующей ручной правки.

Поддержка охватывает кириллицу, арабские, иероглифические и другие системы письма. Мультиязычность реализована без потери качества генерации других элементов изображения.

Ограничение сохраняется для очень малых размеров шрифта и плотного расположения текста, однако стандартные задачи дизайна решаются практически без артефактов.