Mixtral 8x7B требует меньше памяти чем ожидали разработчики

Модель Mixtral 8x7B от Mistral AI показала неожиданно эффективное использование памяти при работе на GPU. Благодаря архитектуре Mixture of Experts, где активируется только часть параметров при обработке каждого токена, требования к видеопамяти оказались ниже первоначальных прогнозов.

Практические тесты показали, что для инференса в 16-битном формате требуется около 24 ГБ памяти, а не 40-50 ГБ, которые предполагались для плотной модели эквивалентного размера. Это делает модель доступной для более широкого круга оборудования.

Последствия для локального развёртывания

Снижение требований к памяти позволяет запускать Mixtral на относительно доступном оборудовании — одной карте NVIDIA RTX 4090 или двух карт меньшего уровня. Разработчики получили возможность развёртывать высокопроизводительные модели без массивных GPU-кластеров.

Результаты исследования вызвали интерес среди компаний, ориентированных на локальный запуск моделей. MoE-архитектура начинает рассматриваться как основная стратегия для балансировки мощности и доступности оборудования.

Тренд на более эффективные архитектуры открывает путь к развёртыванию современных LLM на бюджетном серверном оборудовании, что может ускорить внедрение LLM в корпоративных инфраструктурах.