Скорость инференса стала критерием выбора, а не только качество

Опубликованные тесты качества ничего не говорят о том, за сколько токенов в секунду модель работает. Мощная модель, которая обдумывает каждое слово, может оказаться дороже дешёвой, но шустрой альтернативы, особенно на высоких объёмах.

Для пользователя это выглядит как выбор между ждать хороший ответ или получить быстро посредственный. На самом деле это часто выбор между разными экономическими моделями: либо платить за время размышления, либо переписать задачу, чтобы модель работала быстрее.

Где скорость критична

В интерактивных сценариях, где пользователь смотрит на экран, задержка в полсекунды ощущается иначе, чем в фоновых процессах. Для чатов скорость часто важнее абсолютной точности, а для аналитических отчётов спешить можно больше.

Провайдеры начинают публиковать цифры по инференсу наравне с качеством, но сравнивать их напрямую нельзя: скорость зависит от железа, в котором раскручена модель. Одна и та же модель на разных серверах работает по-разному.

Практика показывает, что быстрая и неточная модель часто выигрывает у медленной и точной, когда нужно обработать тысячи запросов в день. Времени на итерацию всегда больше, чем временной бюджет на сам инференс.