Llama 3.5 требует всего 6GB памяти в int4: новый рекорд доступности
Llama 3.5 в формате int4 укладывается в 6 гигабайт оперативной памяти, что позволяет запускать модель на среднестатистических потребительских устройствах. Такой объём памяти есть на старых ноутбуках, настольных компьютерах среднего уровня и многих мобильных девайсах с достаточным запасом.
Квантизация до 4 бит значительно сокращает размер модели без критического падения качества. Для задач классификации, рерайтинга текста и общих диалогов потери в точности остаются в пределах 1–3 процентов, что приемлемо для большинства практических применений.
Развитие локальных решений
Достижение этого порога важно для популяризации локального запуска моделей. 6 гигабайт — это планка, при которой открытые модели становятся конкурентоспособны с облачными сервисами по удобству, но при этом дают пользователю полный контроль и приватность.
Скорость работы квантизованной модели на обычном оборудовании остаётся приемлемой для интерактивных задач. Время ответа на типичный запрос занимает несколько секунд, что достаточно для внутреннего использования в продуктах и исследовательских проектах.
Дальнейшее снижение требований к памяти будет идти за счёт более агрессивной квантизации, дистилляции моделей и специализированных архитектур. Llama 3.5 на 6 гигабайтах — промежуточный результат, который открывает локальный запуск для более широкого круга разработчиков.