Лимит на размер файла часто меньше, чем объявляется в документации

API часто рекламируют поддержку контекстного окна в несколько миллионов токенов. На бумаге это звучит как почти неограниченный размер. На практике разработчик загружает файл размером в мегабайты и получает ошибку того, что входные данные слишком большие.

Причина не в самой длине окна, а в том, как считаются токены. Разные провайдеры используют разные токенизаторы. Один мегабайт русского текста может быть разным объёмом в токенах в зависимости от алгоритма.

Как узнать реальный лимит

Документация часто не уточняет этот момент, и разработчик узнаёт реальное ограничение после первого отказа. Чтобы избежать этого, нужно самому запустить токенизацию на образце данных и вычислить реальный предел.

Часть провайдеров добавили в ответ размер входного и выходного потока в токенах. Это позволяет разработчику обкатать размер локально перед боевым использованием.

Странно, что фраза «максимум 200 тысяч токенов в запросе» ещё не стала стандартной в документации, но постепенно эта точность распространяется.