Quantized vs Full Precision: где теряется качество при сжатии весов

Квантизация переводит веса из 32-битного формата в 8-битный или 4-битный, что существенно уменьшает объём памяти и ускоряет вычисления. Большинство языковых задач не требуют полной точности, поэтому потери остаются незаметными для пользователя.

На простых задачах типа классификации текста или суммаризации разница между квантизованной и полноточной моделью незначительна, около 1—3% точности. Однако на задачах, требующих точного счёта, логических вычислений или работы с редкими языками, потери более выраженные.

Где видна деградация

Математические операции, кодогенерация и обработка специализированного контента теряют качество чувствительнее всего. Квантизация 4-битная влияет сильнее, чем 8-битная, но обе остаются практичными для большинства случаев.

Выбор уровня квантизации зависит от доступной памяти и требований к качеству. На промышленных стендах часто используют компромиссный вариант — 8-битную квантизацию с сохранением полной точности критических слоёв модели.

Для оценки пригодности квантизованной модели нужно её протестировать на реальных задачах проекта, а не полагаться на усреднённые метрики, которые могут скрывать особенности работы на узких наборах данных.