Quantization-aware training: обучение сразу под сжатие
Quantization-aware training (QAT) перемещает процесс сжатия с последней фазы разработки модели на саму фазу обучения. Вместо того чтобы сначала обучить полноточную модель, а потом её сжать, исследователи теперь закладывают квантизацию прямо в лосс-функцию.
Это даёт существенный прирост в качестве инференса на сжатых битностях. Модели, обученные с QAT, показывают меньше деградации качества при переводе на 4 или 8 бит, чем модели, квантованные постфактум.
Практическое воздействие
Подход удешевляет затраты на инференс и позволяет запускать большие модели на более слабом оборудовании. Параллельно снижается электропотребление и время отклика.
Несколько исследовательских групп уже продемонстрировали, что модели с QAT по качеству почти не уступают полноточным аналогам, оставаясь при этом значительно компактнее.
Ожидается, что производители фреймворков для обучения встроят QAT в стандартные тулчейны, а разработчики локальных моделей начнут добавлять квантованные версии в свои релизы.