Вес модели растёт медленнее, чем её возможности в последних релизах
Эффективность архитектур улучшается благодаря лучшим схемам внимания, оптимизированным токенизаторам и умнее подобранным данным для обучения. Каждый новый релиз получает больше «смысла» на тот же вес, чем его предшественник.
Данные берутся из публичных бенчмарков HumanEval, MMLU, GSM8K и других, где тренд явный. Модели 2024 года в 7–13 Гб давали результаты, сопоставимые с 70-гигабайтными моделями 2022-го.
Последствия для индустрии
Это значит, что локальный запуск становится всё выгоднее со временем: нет нужды менять оборудование каждый год, новая версия модели работает на том же железе лучше. Стартапы могут дольше откладывать инвестиции в инфраструктуру.
Закрытые облачные сервисы теряют аргумент о недостижимости качества на локальном оборудовании. Размер модели перестаёт быть барьером, остаётся только удобство интеграции.
Прогноз: через два года 10-гигабайтная открытая модель будет конкурировать с облачными решениями не по цене, а по скорости и качеству.