Мобильный ONNX Runtime: запуск моделей на мобильниках без облака

ONNX Runtime Mobile достиг производственной зрелости и позволяет запускать нейросети прямо на смартфонах и планшетах. Библиотека оптимизирована под ARM-архитектуру и потребляет на 60% меньше памяти, чем полная версия Runtime.

Инференс работает без подключения к облаку, что гарантирует конфиденциальность данных и стабильную работу при плохом интернете. Типичная задержка на среднем смартфоне — 50–200 миллисекунд для моделей классификации изображений.

Практическое применение

Первые приложения уже в AppStore и Play Market: переводчики, анализаторы речи, детекторы лиц работают локально без отправки данных на серверы. Это открывает рынок для стартапов, которые не могут позволить себе облачную инфраструктуру.

Ограничение остаётся прежним: мобильник выдерживает модели до 2–4 миллиардов параметров, для больших нужен облако или десктоп. Но для специализированных задач этого достаточно.

Будущее мобильных ИИ-приложений связано именно с локальным инференсом. Microsoft и Google активно развивают свои инструменты, но ONNX Runtime захватил большинство open-source проектов.