Flux научился рисовать кириллицу без ошибок в первой попытке

Проблема рендеринга нелатинского текста в генерируемых изображениях решалась годами. Большинство диффузионных моделей обучались на англоязычных датасетах с преобладанием латиницы, что приводило к деградации кириллицы и даже вымыслу несуществующих символов.

Flux решил задачу переобучением на расширенном корпусе текстовых изображений, включавшем кириллицу, греческий и арабский алфавиты. Токенизация была переработана для независимого кодирования каждого символа вместо фонетических единиц.

Результаты тестирования

В открытых тестах модель выдала корректный русский текст в первой попытке в 96 процентах случаев при длине строк до 20 символов. Ошибки возникали главным образом при смешанной кириллице и специальных символах.

Этот результат позволяет использовать Flux для создания графического контента с русским текстом без постобработки. Дизайнеры могут теперь полагаться на точность синтеза вместо ручной правки в графических редакторах.

Разработчики других моделей запустили программы улучшения поддержки кириллицы, признав её рыночный спрос в русскоязычных регионах и странах СНГ.