Кэширование промптов стало главным способом снизить счёт за токены
Счёт за обращения к языковым моделям в реальных продуктах складывается почти целиком из входных токенов: системная инструкция, описания инструментов, примеры и куски кода отправляются заново при каждом шаге агента. Разработчики всё чаще замечают, что переписывать сам промпт ради экономии бессмысленно — выигрыш даёт не длина, а порядок блоков.
Механика проста: провайдер запоминает префикс запроса и при повторном обращении с тем же началом считает его по сниженной ставке. Значит, всё стабильное — роль, правила, схемы инструментов — должно стоять в начале, а переменное, вроде текущего вопроса пользователя, уходить в конец. Одна переставленная строка в середине системного блока обнуляет попадание в кэш целиком.
Где кэш ломается незаметно
Типичный сценарий провала выглядит так: в системную инструкцию подставляется текущая дата или идентификатор сессии. Формально это одна короткая подстановка, фактически — новый префикс на каждый запрос и полная оплата контекста. То же происходит, когда список инструментов собирается динамически и порядок элементов не зафиксирован.
В сообществе обсуждают и обратную крайность: ради кэша контекст раздувают до предела, забывая, что долгий префикс сам по себе замедляет обработку и повышает шанс, что модель потеряет важную деталь в середине. Разумная граница — держать в кэшируемой части то, что действительно повторяется в каждом вызове, а остальное подгружать инструментами по требованию.
Что это значит
Подробности и первичное описание опубликованы на странице как получить фотографию, а не рисунок, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Инструменты для разработчиков» — он пополняется по мере выхода новых сообщений.