Токенизация текста улучшена для 50 новых языков и диалектов

Группа лингвистов и специалистов по NLP представила обновлённые алгоритмы токенизации для 50 ранее неподдерживаемых языков и диалектов. Новые токенизаторы учитывают морфологические и синтаксические особенности каждого языка, повышая точность обработки текста.

Тесты показали, что оптимизированная токенизация снижает среднее количество токенов на предложение до 7–12 процентов по сравнению с универсальным подходом. Это напрямую влияет на скорость обработки и стоимость запросов к моделям.

Практическое применение

Особый прирост производительности наблюдается для языков с сложной морфологией — финского, венгерского, турецкого и славянских языков. Высокой эффективностью отличились также токенизаторы для азиатских языков, где слова не разделены пробелами.

Распределённые системы, обучающие многоязычные модели, смогут сократить время обучения на 8–15 процентов при использовании новых токенизаторов. Код и модели опубликованы в открытом доступе для использования сообществом.

Авторы работы призывают разработчиков модельных платформ интегрировать улучшенные токенизаторы, чтобы расширить качественную поддержку редких языков в глобальных AI-системах.