Запуск Mixtral на M3 Max: почему unified memory спасает локальный инференс

Mixtral — модель смешанной экспертизы (mixture of experts), которая требует много памяти для хранения весов разных слоёв. На стандартных GPU это создавало препятствие для запуска на домашних машинах, но Apple Silicon решил проблему через unified memory архитектуру.

Unified memory позволяет процессору и GPU обращаться к одному пулу памяти, исключая дорогостоящие копирования между памятью процессора и видеопамятью. Это критично для Mixtral, где модель должна загружать разные наборы параметров в зависимости от входных данных.

Практический опыт запуска

Пользователи M3 Max сообщают о стабильном запуске Mixtral 8x7B с приемлемой скоростью инференса, порядка 10–15 токенов в секунду для генерации текста. Это достаточно для интерактивного использования в приложениях на одной машине.

Успех Mixtral на M3 Max привлёк внимание разработчиков к другим моделям, требовательным к памяти. Начали тестировать дистиллированные версии больших моделей и адаптированные архитектуры, которые лучше работают с unified memory.

Apple расширяет поддержку локального инференса в своих разработческих инструментах, что поднимает планку для аппаратного обеспечения. Конкуренция с облачными API растёт, и производители мобильных процессоров инвестируют в оптимизацию ML-стека.