Flux научился рисовать кириллицу без ошибок в первой попытке
Проблема рендеринга нелатинского текста в генерируемых изображениях решалась годами. Большинство диффузионных моделей обучались на англоязычных датасетах с преобладанием латиницы, что приводило к деградации кириллицы и даже вымыслу несуществующих символов.
Flux решил задачу переобучением на расширенном корпусе текстовых изображений, включавшем кириллицу, греческий и арабский алфавиты. Токенизация была переработана для независимого кодирования каждого символа вместо фонетических единиц.
Результаты тестирования
В открытых тестах модель выдала корректный русский текст в первой попытке в 96 процентах случаев при длине строк до 20 символов. Ошибки возникали главным образом при смешанной кириллице и специальных символах.
Этот результат позволяет использовать Flux для создания графического контента с русским текстом без постобработки. Дизайнеры могут теперь полагаться на точность синтеза вместо ручной правки в графических редакторах.
Разработчики других моделей запустили программы улучшения поддержки кириллицы, признав её рыночный спрос в русскоязычных регионах и странах СНГ.