Запросы на английском стали точнее чем на русском на 15 процентов
Исследование компаративного тестирования генеративных моделей выявило диспаритет в точности обработки текстовых запросов. Команда поочередно отправляла идентичные описания на английском и русском языках, сравнивая результаты по метрикам семантического соответствия и пользовательского восприятия.
Дефицит точности обусловлен объёмом обучающих данных и приоритизацией английского языка при разработке моделей. Российский сегмент интернета недостаточно представлен в большинстве открытых датасетов для обучения.
Причины и последствия
Большинство крупных моделей изображений разработано компаниями с опорой на англоязычный контент. Расширение поддержки других языков требует дополнительных ресурсов на сбор и разметку данных.
Пользователи русскоязычных сервисов сообщают о необходимости перефразировать запросы на английский для получения более релевантных результатов. Ситуация стимулирует разработку локальных моделей с приоритетом на русский язык.
Постепенно языковой разрыв сокращается — крупные разработчики начинают инвестировать в мультиязычное обучение моделей изображений.