Стартап создал фреймворк для быстрого развёртывания LLM на edge-устройствах

Стартап EdgeAI выпустил фреймворк для развёртывания LLM на edge-устройствах с минимальной задержкой и использованием ресурсов. Фреймворк включает встроенные оптимизации для квантизации моделей и сжатия весов без существенного снижения качества.

Поддерживаются популярные архитектуры моделей: Llama, Mistral, Phi с предоставленными бинарниками для ARM и x86 архитектур. Разработчики получают набор инструментов для профилирования и отладки прямо на целевом устройстве.

Сценарии использования

Фреймворк особенно полезен для приложений, требующих низкой задержки и работы в условиях ограниченного интернета. Примеры: системы голосовых помощников, анализ видео на камерах и локальная обработка приватных данных.

Процесс развёртывания автоматизирован: загрузка модели, конвертация формата, оптимизация для целевого оборудования и генерация бинарных файлов происходят через единую команду. Пакет включает примеры интеграции с популярными фреймворками вроде TensorFlow и PyTorch.

Исходный код будет открыт под лицензией MIT, сообщество приглашено к контрибьютам и расширению поддержки новых моделей.