Квантизация 4-bit: как уместить большую модель в 8 Гб
Квантизация 4-bit снижает размер весов модели с 32 бит на число до 4 бит, сохраняя при этом достаточную информацию для точных вычислений. На практике это означает, что 70-миллиардная модель занимает всего 17-20 Гб вместо 140 Гб.
Технически это работает благодаря тому, что большинство значений весов распределены в узком диапазоне. Алгоритм квантизации находит оптимальную шкалу и кодирует числа в 4 бита, теряя при этом точность на уровне ошибок округления.
Практическое применение и ограничения
Пользователи компьютеров с графическими картами на 8-12 Гб видеопамяти могут теперь запускать чат на основе больших моделей локально. Задержка остается приемлемой: 2-5 токенов в секунду.
Минус квантизации — незначительное снижение качества: модель может чуть реже давать точные ответы на сложные вопросы. Для большинства повседневных задач это незаметно.
Инструменты типа GPTQ и bitsandbytes автоматизируют квантизацию, что делает её доступной для пользователей без специального оборудования. Тренд переходит к эффективности: модели становятся меньше, но сохраняют качество.