Стоимость и скорость инференса затмили качество модели
Пять лет назад выбор модели определялся одним показателем: качество ответа. Теперь это лишь одно из условий. Важнее, сколько стоит один запрос, как быстро приходит ответ и работает ли она на вашем оборудовании.
Эта смена произошла не потому, что качество перестало быть важным, а потому, что основной переход случился от научных исследований к production. В лаборатории нужна лучшая модель. На сервере нужна модель, которая не разорит компанию.
Расчёты вытеснили гипотезы
Когда выбираешь между двумя моделями для production, достаточно вычислить: первая обойдётся в десять тысяч в месяц при нужном качестве, вторая — в две тысячи. Первая один процент лучше. Ответ очевиден.
Вендоры моделей это понимают и сражаются не за красивые бенчмарки, а за цену инференса. Кто дешевле и разумно быстро — тот выигрывает в борьбе за клиента.
Это переворачивает мотивы разработчиков: теперь выгодно делать компактную модель, которая работает на дешёвом железе, чем огромную модель на суперкомпьютерах.