GGUF формат: как сжимают большие модели до компактного вида

GGUF формат преобразует веса нейронных сетей из полной точности в низшую, сохраняя логику вычислений. Это даёт возможность запускать многомиллиардные модели на потребительском железе.

Квантизация работает за счёт замены 32-битных чисел на 8- или 4-битные аналоги. Потеря точности незначительна: модель остаётся функциональной, а скорость вывода растёт на 30-50 процентов.

Практические результаты

Модели в GGUF весят в 4-8 раз меньше исходников. Llama 2 70B в полном виде занимает 140 Гб памяти, в GGUF формате 4-битной квантизации — 35 Гб.

Инструменты вроде llama.cpp поддерживают GGUF нативно, позволяя развёртывать модели без GPU и специального ПО. Энтузиасты могут полноценно работать с передовыми моделями на MacBook или старом сервере.

GGUF стал де-факто стандартом открытого сообщества благодаря простоте реализации и совместимости с мобильными устройствами.