Сколько видеопамяти на самом деле требует локальная модель
Самая частая ошибка при первом запуске — считать требования по размеру скачанного файла. Веса действительно занимают основную долю, но рядом с ними в память ложатся кэш внимания, промежуточные активации и служебные буферы фреймворка.
Кэш растёт линейно с длиной контекста и с числом одновременных запросов. Модель, которая спокойно отвечает на короткий вопрос, на длинном документе внезапно упирается в предел памяти — и падает не в начале, а на середине генерации, что сбивает с толку.
Практический способ прикинуть
Разумный ориентир, который обсуждают в сообществе: к размеру весов добавить хотя бы четверть сверху под контекст и запас на фрагментацию. Если после этого остаётся меньше гигабайта свободной видеопамяти, стоит брать более сжатую сборку, а не надеяться на удачу.
Отдельная тема — выгрузка части слоёв в оперативную память. Она позволяет запустить заведомо слишком большую модель, но скорость падает резко, потому что данные каждого шага гоняются через шину. Здесь честнее взять модель поменьше целиком в видеопамяти.
Вывод, который повторяют опытные пользователи: планировать запуск нужно от длины контекста, а не от размера модели. Именно контекст определяет, будет ли конфигурация работать под нагрузкой или только в демонстрации.
Что это значит
Подробности и первичное описание опубликованы на странице «разбор консистентности персонажа», там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Открытые модели и локальный запуск — он пополняется по мере выхода новых сообщений.