Стартап создал фреймворк для быстрого развёртывания LLM на edge-устройствах
Стартап EdgeAI выпустил фреймворк для развёртывания LLM на edge-устройствах с минимальной задержкой и использованием ресурсов. Фреймворк включает встроенные оптимизации для квантизации моделей и сжатия весов без существенного снижения качества.
Поддерживаются популярные архитектуры моделей: Llama, Mistral, Phi с предоставленными бинарниками для ARM и x86 архитектур. Разработчики получают набор инструментов для профилирования и отладки прямо на целевом устройстве.
Сценарии использования
Фреймворк особенно полезен для приложений, требующих низкой задержки и работы в условиях ограниченного интернета. Примеры: системы голосовых помощников, анализ видео на камерах и локальная обработка приватных данных.
Процесс развёртывания автоматизирован: загрузка модели, конвертация формата, оптимизация для целевого оборудования и генерация бинарных файлов происходят через единую команду. Пакет включает примеры интеграции с популярными фреймворками вроде TensorFlow и PyTorch.
Исходный код будет открыт под лицензией MIT, сообщество приглашено к контрибьютам и расширению поддержки новых моделей.