Гибридное сжатие: чередование квантизации и прунинга спасло точность
Традиционный путь: сначала урезаешь веса (прунинг), потом сжимаешь числа до низкой разрядности (квантизация). Гибридное сжатие делает иначе: чередует оба метода на разных слоях модели в зависимости от чувствительности слоя к потере информации.
Результат: модель Llama 2 13B сохранила 97 процентов своей производительности при сжатии в 8 раз, тогда как традиционный путь давал только 91 процент. На задачах классификации и QA разница особенно заметна.
Техника применения
Алгоритм определяет, какие веса в слое критичны для функции, и сохраняет их в высокой разрядности, а остальные квантует. На соседних слоях стратегия инвертируется в зависимости от градиентов во время дообучения.
Фреймворк для гибридного сжатия вышел в открытый доступ и уже интегрирован в PyTorch Quantization. Разработчики используют его для подготовки весов к мобильным и встраиваемым платформам.
Новый метод стал стандартом де-факто для производственного сжатия открытых моделей среднего размера (7–13 млрд параметров).