Mistral Instruct в ONNX: запуск инференса на Windows без Visual Studio

Mistral выпустила ONNX-версию модели Mistral Instruct, что упрощает развёртывание на Windows и других платформах. ONNX (Open Neural Network Exchange) — это открытый стандарт представления нейросетей, который позволяет переносить модели между фреймворками без переписывания кода.

Ключевое преимущество: для запуска не требуется Visual Studio, CUDA Toolkit или других тяжёлых зависимостей. Достаточно Python, ONNX Runtime и несколько мегабайт библиотек — модель запустится на CPU или GPU через ONNX провайдеров.

Экосистема вокруг ONNX

Mistral Instruct 7B в ONNX весит около 7 ГБ для версии FP32, но есть квантизированные варианты. Инференс работает через Python через простой API: загрузить сессию ONNX Runtime, передать входные токены, получить выход.

Это открывает путь для встраивания моделей в настольные приложения, сервисы на базе .NET и облачные платформы, где Python не лучший выбор. Windows-разработчики теперь могут обойтись без Linux-контейнеров для локального запуска.

Mistral планирует расширить ONNX-поддержку на другие версии модели, включая большие инструментные варианты.