Квантизация INT4 vs INT8: где терять качество больнее всего

INT8 и INT4 квантизация — два основных способа сжатия весов нейросетей для снижения объёма памяти. INT8 хранит веса в 8-битных целых числах, INT4 — в 4-битных. Разница в размере колоссальна: модель сжимается в два раза, но цена — потеря точности представления весов.

Эмпирически выяснилось, что INT4 квантизация почти незаметна на задачах с фиксированным ответом: классификация, NER, простой Q&A. Модель отвечает примерно так же, как в полной точности. Но на задачах, требующих рассуждения или творчества, потери становятся видны: логические цепочки рвутся, образность стирается, ответы становятся шаблоннее.

Практический компромисс

Исследователи рекомендуют INT4 квантизацию для production-систем, где нужна скорость и компактность, но недопустимы ошибки: модели для классификации, извлечения сущностей, простого поиска подобия. INT8 выбирают для приложений, где важна точность рассуждения: аналитика, генерация кода, перефразирование.

Гибридные подходы становятся популярнее: ключевые слои моделей (обычно attention и первые слои) хранятся в INT8 или даже в полной точности, а остальные веса сжимаются до INT4. Так удаётся сохранить качество критичных операций при экономии памяти.

Следующее поколение квантизации, вероятно, будет адаптивным: система сама определит, какие веса можно сжать агрессивнее, без явного разбора архитектуры вручную.