Длинный контекст на своей машине упирается не в модель, а в память
Открытые модели всё чаще заявляют внушительные размеры контекстного окна. На локальном запуске эта цифра оказывается теоретической: реально доступная длина определяется тем, сколько памяти остаётся после загрузки весов.
Кэш внимания растёт вместе с контекстом и на длинных документах способен занять больше, чем сама модель. Именно поэтому конфигурация, спокойно работающая на коротких запросах, внезапно отказывает на попытке скормить ей большой файл.
Способы уложиться в память
Часть движков умеет хранить кэш в сжатом виде, часть позволяет ограничить длину окна вручную. Оба приёма работают, но требуют осознанного выбора: сжатый кэш немного портит качество на длинных зависимостях, обрезка окна просто теряет начало разговора.
Более здравая альтернатива, о которой всё чаще говорят практики, — не тащить весь документ в контекст, а разбивать его и подавать только нужные фрагменты. Это дешевле по памяти и, как ни странно, часто точнее, чем гигантское окно.
Что это значит
Подробности и первичное описание опубликованы на странице разбор стоимости и тарифов, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Открытые модели и локальный запуск» — он пополняется по мере выхода новых сообщений.