Кириллица в сгенерированных картинках остаётся сложнее латиницы

Русскоязычные пользователи генераторов регулярно сталкиваются с одной и той же асимметрией. Английское слово на вывеске модель выводит разборчиво, то же слово по-русски рассыпается: буквы подменяются похожими по начертанию, появляются несуществующие символы, часть знаков отзеркалена.

Причина прозаична и лежит в данных. Изображений с латинскими надписями в обучающих наборах на порядки больше, поэтому форма латинских букв усвоена подробно, а кириллические начертания модель знает как общий стилистический признак — «похоже на русский текст», но без надёжной привязки к конкретным символам.

Обходные пути

Практика выработала несколько приёмов. Короткие слова из букв, совпадающих с латиницей по форме, получаются заметно лучше остальных. Крупный кегль почти всегда выигрывает у мелкого. А самый предсказуемый вариант — генерировать пустую поверхность вывески и накладывать текст отдельным слоем в редакторе.

Отдельная сложность — редактирование уже существующей русской надписи по текстовому описанию. Модель охотно перерисовывает область, но при этом меняет и шрифт, и разрядку, так что заменить одно слово, не тронув остальное, удаётся редко.

Разрыв постепенно сокращается по мере того, как в обучающие наборы попадает больше неанглоязычных изображений, но пока для русского текста в кадре ручной слой остаётся надёжнее любой генерации.

Что это значит

Подробности и первичное описание опубликованы на странице обзор генератора изображений Nano Banana, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Нейросети для генерации изображений — он пополняется по мере выхода новых сообщений.