Когда перезагрузка модели дешевле, чем чистка памяти

При работе с большими моделями на GPU управление памятью становится узким местом. Исследователи из нескольких лабораторий независимо заметили, что в определённых сценариях затраты на перезагрузку весов ниже, чем на аккуратную очистку и переиспользование выделенной памяти.

Эффект проявляется на картах с ограниченной пропускной способностью и когда паттерны обращения к памяти плохо предсказуемы. Вместо фрагментации вычислительная система проще перезапускает модель.

Следствие для оптимизации

Находка влияет на дизайн инферен-серверов и пулинг моделей — логика распределения задач должна учитывать эту специфику вместо глухого кэширования.

На практике это означает, что для мобильных установок и edge-устройств простая перезагрузка может быть рациональнее, чем сложные схемы управления состоянием.

Такие микрооптимизации обычно остаются в коде, но постепенно накапливаются в фреймворках инферен-движков вроде vLLM и TensorRT.