Открытые веса выросли в размере, но упали в требованиях к памяти

За последний год размер открытых моделей вырос с 7–13 млрд параметров до 40–70 млрд, но одновременно упали требования к пиковому потреблению памяти. Это произошло благодаря использованию более эффективных архитектур и квантизации.

Достичь этого помогли оптимизированные форматы весов, KV-кэш сжатие и дробное квантование. Теперь модель из 70 млрд параметров может работать на GPU с 16 ГБ VRAM, тогда как раньше понадобилась бы карта с 48 ГБ.

Перелом в доступности

Это означает, что качество локального инференса перестало прямо зависеть от цены оборудования. Исследователи и небольшие компании теперь могут экспериментировать с большими моделями на стандартных потребительских GPU.

Вместе с тем, размер дискового хранилища по-прежнему растёт, что усложняет распространение и быстрый запуск моделей из интернета.

Тренд указывает на то, что будущее локального инференса лежит не в уменьшении моделей, а в их оптимизации под реальные ресурсы пользователя.