Когда int4 веса весят меньше чем параметры слоя нормализации
Исследование показывает парадоксальный эффект современной квантизации: при сжатии весов модели до 4 бит их объём становится меньше, чем объём параметров LayerNorm и BatchNorm слоёв, которые остаются в полной точности. Это указывает на несбалансированность компрессии архитектуры нейросетей.
Проблема возникает потому, что нормализирующие слои содержат масштабирующие коэффициенты и смещения, которые хранятся в FP32 или FP16. На больших моделях даже эти техническая параметры занимают значительный объём памяти, тогда как основные веса уже сжаты.
Практическое следствие
Разработчики начинают квантизировать и параметры нормализации, либо группировать их эффективнее. Это привело к появлению смешанных стратегий квантизации, где разные слои сжимаются на разные глубины в зависимости от их чувствительности.
Открытые реализации вроде AutoGPTQ и GPTQ-for-LLaMA уже поддерживают такую селективную компрессию. Результат — модели 7-13 млрд параметров теперь занимают 2-3 ГБ без заметной потери качества.
Эффект имеет значение для устройств с жёсткими ограничениями памяти, где каждый мегабайт решает, поместится ли модель в видеопамять или нет.