Together AI добавила кэширование промптов в REST API для снижения задержек
Together AI внедрила поддержку кэширования промптов в REST API. Механизм позволяет сохранять часто используемые части запросов на сервере и переиспользовать их без повторной обработки, что сокращает задержки и снижает расходы на вычисления.
Кэширование работает на уровне контекста: система идентифицирует повторяющиеся фрагменты промптов и переиспользует результаты их обработки. Это особенно полезно для приложений с частыми запросами к одним и тем же инструкциям или документам.
Практическое применение
Функция актуальна для систем обработки больших объёмов текста, где значительная часть контекста остаётся неизменной между запросами. Разработчики отмечают снижение задержки на 30–50% при типичных сценариях с повторяющимся контентом.
API поддерживает явное управление кэшем через параметры запроса, что позволяет приложениям контролировать стратегию сохранения данных и выбирать баланс между скоростью и актуальностью результатов.
Механизм доступен во всех пакетах обслуживания и не требует изменения кода — достаточно включить параметр в конфигурацию API.