Стоимость и скорость инференса затмили качество модели

Пять лет назад выбор модели определялся одним показателем: качество ответа. Теперь это лишь одно из условий. Важнее, сколько стоит один запрос, как быстро приходит ответ и работает ли она на вашем оборудовании.

Эта смена произошла не потому, что качество перестало быть важным, а потому, что основной переход случился от научных исследований к production. В лаборатории нужна лучшая модель. На сервере нужна модель, которая не разорит компанию.

Расчёты вытеснили гипотезы

Когда выбираешь между двумя моделями для production, достаточно вычислить: первая обойдётся в десять тысяч в месяц при нужном качестве, вторая — в две тысячи. Первая один процент лучше. Ответ очевиден.

Вендоры моделей это понимают и сражаются не за красивые бенчмарки, а за цену инференса. Кто дешевле и разумно быстро — тот выигрывает в борьбе за клиента.

Это переворачивает мотивы разработчиков: теперь выгодно делать компактную модель, которая работает на дешёвом железе, чем огромную модель на суперкомпьютерах.