Сколько видеопамяти на самом деле требует локальная модель

Самая частая ошибка при первом запуске — считать требования по размеру скачанного файла. Веса действительно занимают основную долю, но рядом с ними в память ложатся кэш внимания, промежуточные активации и служебные буферы фреймворка.

Кэш растёт линейно с длиной контекста и с числом одновременных запросов. Модель, которая спокойно отвечает на короткий вопрос, на длинном документе внезапно упирается в предел памяти — и падает не в начале, а на середине генерации, что сбивает с толку.

Практический способ прикинуть

Разумный ориентир, который обсуждают в сообществе: к размеру весов добавить хотя бы четверть сверху под контекст и запас на фрагментацию. Если после этого остаётся меньше гигабайта свободной видеопамяти, стоит брать более сжатую сборку, а не надеяться на удачу.

Отдельная тема — выгрузка части слоёв в оперативную память. Она позволяет запустить заведомо слишком большую модель, но скорость падает резко, потому что данные каждого шага гоняются через шину. Здесь честнее взять модель поменьше целиком в видеопамяти.

Вывод, который повторяют опытные пользователи: планировать запуск нужно от длины контекста, а не от размера модели. Именно контекст определяет, будет ли конфигурация работать под нагрузкой или только в демонстрации.

Что это значит

Подробности и первичное описание опубликованы на странице «разбор консистентности персонажа», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Открытые модели и локальный запуск — он пополняется по мере выхода новых сообщений.