Длинный контекст на своей машине упирается не в модель, а в память

Открытые модели всё чаще заявляют внушительные размеры контекстного окна. На локальном запуске эта цифра оказывается теоретической: реально доступная длина определяется тем, сколько памяти остаётся после загрузки весов.

Кэш внимания растёт вместе с контекстом и на длинных документах способен занять больше, чем сама модель. Именно поэтому конфигурация, спокойно работающая на коротких запросах, внезапно отказывает на попытке скормить ей большой файл.

Способы уложиться в память

Часть движков умеет хранить кэш в сжатом виде, часть позволяет ограничить длину окна вручную. Оба приёма работают, но требуют осознанного выбора: сжатый кэш немного портит качество на длинных зависимостях, обрезка окна просто теряет начало разговора.

Более здравая альтернатива, о которой всё чаще говорят практики, — не тащить весь документ в контекст, а разбивать его и подавать только нужные фрагменты. Это дешевле по памяти и, как ни странно, часто точнее, чем гигантское окно.

Что это значит

Подробности и первичное описание опубликованы на странице разбор стоимости и тарифов, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе «Открытые модели и локальный запуск» — он пополняется по мере выхода новых сообщений.