Размер весов и скорость инференса: не коррелируют линейно
Эксперименты с открытыми трансформерами выявили, что модель с 13 миллиардами параметров может работать медленнее, чем оптимизированная под железо версия с 7 миллиардами. Скорость зависит от архитектуры, организации памяти и способа квантизации весов.
Разработчики, выбирая модель для локального запуска, полагались на размер как на главный метрик. Новые данные указывают на необходимость прямого бенчмарка на целевом оборудовании перед выбором решения.
Оптимизация под железо
Знаменитые компиляторы и фреймворки для инференса могут переделать порядок операций так, чтобы меньшая модель обогнала большую по отклику. Параллелизм на уровне памяти и кэша часто важнее чистого количества параметров.
Команды, разворачивающие открытые модели, теперь проверяют время до первого токена и пропускную способность на реальных серверах. Это стало критичнее, чем сравнение размеров весов в литературе.
Результат — более гибкий выбор архитектур для конкретных задержек и бюджетов инфраструктуры.