Какой объём VRAM нужен для инференса длинного контекста
Инфернес длинного контекста требует существенно больше видеопамяти, чем обработка коротких запросов. Для моделей размером 7–13 миллиардов параметров с контекстом в 32 тысячи токенов нужно 16–24 гигабайта VRAM, а для контекста в 128 тысяч токенов потребление может вырасти до 40–48 гигабайт.
Точный объём зависит от точности представления весов: модели в формате float32 занимают больше памяти, чем int8 или int4 quantized версии. Также влияет выбор внимания: обычный механизм требует квадратичное относительно длины контекста количество памяти, тогда как flash attention или другие оптимизированные реализации снижают потребление.
Роль batch-размера и кеширования
При одновременной обработке нескольких запросов (большой batch-размер) потребление растёт линейно. Кеширование активаций между запросами к модели может сэкономить до трети видеопамяти, но требует дополнительной реализации.
На практике для домашних установок рекомендуется 24–48 гигабайт VRAM для работы с контекстом свыше 32 тысяч токенов без существенных задержек. Альтернатива — использовать quantization до int4 или перейти на облачные сервисы с мощной видеокартой.
Производители видеокарт и создатели фреймворков постоянно оптимизируют алгоритмы. Обновления PyTorch, Hugging Face Transformers и специализированные библиотеки регулярно снижают требования на 10–20 процентов без потери качества вывода.