Загрузка весов слой за слоем: когда полнота модели не влезет в память

Если видеокарта не вмещает всю модель целиком, новый подход загружает слои по мере необходимости: когда инференс переходит на следующий слой сети, предыдущий выгружается из памяти. Это медленнее, чем полная загрузка, но позволяет работать с моделью вообще.

Техника уменьшает задержку между токенами примерно на 30-50% по сравнению с полным перезагружением весов с диска на каждый шаг. Использование быстрого NVMe хранилища критично для скорости.

Где это помогает

Разработчики из дома или небольших офисов с одной видеокартой 8-12 ГБ теперь могут экспериментировать с LLaMA 70B или Mistral 120B без облачных сервисов. Качество ответов полное, ограничение только в скорости.

vLLM и его аналоги встроили поддержку такой загрузки, выбирая оптимальную границу между объёмом памяти и скоростью обработки. Пользователь вводит максимум VRAM, и система сама решает, какие слои кэшировать.

На серверах эта техника менее актуальна, но для локального опыта или демонстраций она расширяет возможности. Открытые модели становятся доступнее даже с ограниченным железом.