Мобильный ONNX Runtime: запуск моделей на мобильниках без облака
ONNX Runtime Mobile достиг производственной зрелости и позволяет запускать нейросети прямо на смартфонах и планшетах. Библиотека оптимизирована под ARM-архитектуру и потребляет на 60% меньше памяти, чем полная версия Runtime.
Инференс работает без подключения к облаку, что гарантирует конфиденциальность данных и стабильную работу при плохом интернете. Типичная задержка на среднем смартфоне — 50–200 миллисекунд для моделей классификации изображений.
Практическое применение
Первые приложения уже в AppStore и Play Market: переводчики, анализаторы речи, детекторы лиц работают локально без отправки данных на серверы. Это открывает рынок для стартапов, которые не могут позволить себе облачную инфраструктуру.
Ограничение остаётся прежним: мобильник выдерживает модели до 2–4 миллиардов параметров, для больших нужен облако или десктоп. Но для специализированных задач этого достаточно.
Будущее мобильных ИИ-приложений связано именно с локальным инференсом. Microsoft и Google активно развивают свои инструменты, но ONNX Runtime захватил большинство open-source проектов.