Что на самом деле ограничивает скорость модели на домашней карте

Интуиция подсказывает, что генерация текста упирается в вычислительную мощность видеокарты. На практике на однопользовательском сценарии узким местом почти всегда оказывается пропускная способность памяти.

Причина в самой механике вывода: чтобы сгенерировать один токен, нужно прочитать все веса модели. Карта с высокой пропускной способностью будет быстрее той, у которой формально больше вычислительных блоков, но память медленнее.

Почему пакетная обработка ведёт себя иначе

Как только запросов становится много, картина переворачивается. Веса читаются один раз на целую пачку запросов, вычислений становится больше, и вот тогда важна уже сырая мощность. Домашний сценарий и серверный оптимизируются по разным параметрам.

Из этого следует практический совет, который часто повторяют: для личного использования выбирать карту по объёму и скорости памяти, а не по позиции в маркетинговой линейке. Сильно урезанная по памяти модель верхнего сегмента проигрывает более скромной с широкой шиной.

Что это значит

Подробности и первичное описание опубликованы на странице «разбор волны интереса к ИИ-редактору изображений», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Открытые модели и локальный запуск — он пополняется по мере выхода новых сообщений.