Нейросетевой вес как сжатый предел: теория о размере квантизации
Работа из DeepMind и Anthropic предлагает новый взгляд на квантизацию: вес в нейросети можно рассматривать как сжатый код информации, которая необходима для воспроизведения выхода модели. На этом основании авторы вывели теоретический предел, до которого можно сжать вес без потери функциональности.
Согласно теории, размер квантизации связан с шумом, который модель может переносить без влияния на качество. Если вес кодирует информацию в 5 бит, дальнейшее сжатие вводит шум, который модель не может игнорировать, — и качество падает.
Практическое применение
Фреймворк позволяет предсказывать оптимальную битность для каждого слоя или даже каждого веса, не проводя многочасовых экспериментов. Это ускоряет разработку стратегий квантизации и даёт объяснение, почему одни слои переносят int2, а другие требуют int8.
Открытые реализации начинают применять эти принципы. Например, инструменты вроде quanto и bitsandbytes уже используют адаптивную глубину битов на основе анализа распределения весов.
Результаты показывают, что теория согласуется с экспериментом: модели, квантизованные по предложенным рекомендациям, сохраняют качество лучше, чем при единообразной компрессии.