Когда int4 веса весят меньше чем параметры слоя нормализации

Исследование показывает парадоксальный эффект современной квантизации: при сжатии весов модели до 4 бит их объём становится меньше, чем объём параметров LayerNorm и BatchNorm слоёв, которые остаются в полной точности. Это указывает на несбалансированность компрессии архитектуры нейросетей.

Проблема возникает потому, что нормализирующие слои содержат масштабирующие коэффициенты и смещения, которые хранятся в FP32 или FP16. На больших моделях даже эти техническая параметры занимают значительный объём памяти, тогда как основные веса уже сжаты.

Практическое следствие

Разработчики начинают квантизировать и параметры нормализации, либо группировать их эффективнее. Это привело к появлению смешанных стратегий квантизации, где разные слои сжимаются на разные глубины в зависимости от их чувствительности.

Открытые реализации вроде AutoGPTQ и GPTQ-for-LLaMA уже поддерживают такую селективную компрессию. Результат — модели 7-13 млрд параметров теперь занимают 2-3 ГБ без заметной потери качества.

Эффект имеет значение для устройств с жёсткими ограничениями памяти, где каждый мегабайт решает, поместится ли модель в видеопамять или нет.