GGUF формат: как сжимают большие модели до компактного вида
GGUF формат преобразует веса нейронных сетей из полной точности в низшую, сохраняя логику вычислений. Это даёт возможность запускать многомиллиардные модели на потребительском железе.
Квантизация работает за счёт замены 32-битных чисел на 8- или 4-битные аналоги. Потеря точности незначительна: модель остаётся функциональной, а скорость вывода растёт на 30-50 процентов.
Практические результаты
Модели в GGUF весят в 4-8 раз меньше исходников. Llama 2 70B в полном виде занимает 140 Гб памяти, в GGUF формате 4-битной квантизации — 35 Гб.
Инструменты вроде llama.cpp поддерживают GGUF нативно, позволяя развёртывать модели без GPU и специального ПО. Энтузиасты могут полноценно работать с передовыми моделями на MacBook или старом сервере.
GGUF стал де-факто стандартом открытого сообщества благодаря простоте реализации и совместимости с мобильными устройствами.