Открытые веса выросли в размере, но упали в требованиях к памяти
За последний год размер открытых моделей вырос с 7–13 млрд параметров до 40–70 млрд, но одновременно упали требования к пиковому потреблению памяти. Это произошло благодаря использованию более эффективных архитектур и квантизации.
Достичь этого помогли оптимизированные форматы весов, KV-кэш сжатие и дробное квантование. Теперь модель из 70 млрд параметров может работать на GPU с 16 ГБ VRAM, тогда как раньше понадобилась бы карта с 48 ГБ.
Перелом в доступности
Это означает, что качество локального инференса перестало прямо зависеть от цены оборудования. Исследователи и небольшие компании теперь могут экспериментировать с большими моделями на стандартных потребительских GPU.
Вместе с тем, размер дискового хранилища по-прежнему растёт, что усложняет распространение и быстрый запуск моделей из интернета.
Тренд указывает на то, что будущее локального инференса лежит не в уменьшении моделей, а в их оптимизации под реальные ресурсы пользователя.