Кэш весов между запусками модели ускоряет второй и третий запрос
Загрузка весов модели — это не мгновенное копипирование. Движок читает файлы с диска, распределяет память, раскладывает слои по GPU и CPU, готовит кэш. На медленном диске или при большой модели это может занять минуты. После загрузки модель готова к работе и по одному запросу отвечает за доли секунды.
Пользователь, который работает с моделью в интерактивном режиме, может использовать долгоживущий процесс: запустить модель один раз и оставить её в памяти. Второй запрос, третий, десятый приходят мгновенно. Это экономит минуты на каждый сеанс работы.
Долгоживущий процесс в памяти
На мобильных телефонах этого невозможно — приложение убивают система или пользователь. На домашнем компьютере можно оставить процесс работать днями. Некоторые пользователи запускают локальную модель в фоне и работают с ней через REST API из другого приложения, как если бы это был облачный сервис.
Кэш весов работает и на уровне файловой системы: когда модель один раз загружена в памяти OS, повторная загрузка идёт из оперативки, а не с диска. Это особенно полезно на SSD, которые медленнее, чем хотелось бы, но стоят дешевле, чем NVMe.
На локальной машине медленность загрузки превращается в задачу оптимизации, а не в неизбежное ожидание облака.