Квантизированные веса сэкономили гигабайты, но потеряли в точности
Квантизация — сжатие весов нейросети путём снижения точности представления чисел. Переход с float16 на int8 или int4 позволяет поместить модель в несколько раз меньший объём памяти, но вносит шум в вычисления.
Исследование на базе GPT-2, LLaMA и Mistral показало, что при квантизации до 4 бит вероятность ошибок в логических задачах растёт на 5-7%, а качество прозы падает, но остаётся приемлемым. Экономия памяти для Mistral 7B составила 20 Гб из 26.
Компромисс между размером и качеством
Для простых задач вроде сортировки текста, классификации и поиска похожести квантизация вреда не наносит. Для генерации сложных ответов, кода и анализа лучше держать 8-бит версию или полную точность.
Техники постквантизационной тонкой настройки (QAT) позволяют восстановить 1-2% потерь качества, но добавляют сложность при развёртывании. Гибридные подходы, когда критичные слои остаются в полной точности, дают лучший баланс.
Для локального запуска на потребительском железе квантизация остаётся необходимым компромиссом. Выбор уровня сжатия зависит от задачи и доступной памяти, а не от универсального совета.