Квантизация 4-bit: как уместить большую модель в 8 Гб

Квантизация 4-bit снижает размер весов модели с 32 бит на число до 4 бит, сохраняя при этом достаточную информацию для точных вычислений. На практике это означает, что 70-миллиардная модель занимает всего 17-20 Гб вместо 140 Гб.

Технически это работает благодаря тому, что большинство значений весов распределены в узком диапазоне. Алгоритм квантизации находит оптимальную шкалу и кодирует числа в 4 бита, теряя при этом точность на уровне ошибок округления.

Практическое применение и ограничения

Пользователи компьютеров с графическими картами на 8-12 Гб видеопамяти могут теперь запускать чат на основе больших моделей локально. Задержка остается приемлемой: 2-5 токенов в секунду.

Минус квантизации — незначительное снижение качества: модель может чуть реже давать точные ответы на сложные вопросы. Для большинства повседневных задач это незаметно.

Инструменты типа GPTQ и bitsandbytes автоматизируют квантизацию, что делает её доступной для пользователей без специального оборудования. Тренд переходит к эффективности: модели становятся меньше, но сохраняют качество.