Meta открыла библиотеку для оптимизации latency при развёртывании Llama в мобильных приложениях

Meta опубликовала библиотеку для развёртывания Llama на мобильных устройствах под iOS и Android с фокусом на снижение задержки выполнения. Код оптимизирован для мобильных чипов и включает поддержку квантизации при сохранении качества ответов.

Библиотека предлагает несколько предварительно оптимизированных конфигураций моделей Llama разных размеров, от лёгких версий для маломощных устройств до полных вариантов для флагманов. Каждая конфигурация протестирована на реальных устройствах.

Особенности

Инструмент поддерживает GPU-ускорение где возможно и автоматически переходит на CPU при его отсутствии. Встроена система эффективного управления памятью для работы в ограниченной среде мобильных ОС.

Разработчики могут интегрировать библиотеку в свои приложения через простой API на Swift и Kotlin. Документация содержит бенчмарки задержки на популярных моделях устройств.

Код выложен в открытый репозиторий под лицензией Open Source и принимает контрибьюции сообщества разработчиков.