Лимит на размер файла часто меньше, чем объявляется в документации
API часто рекламируют поддержку контекстного окна в несколько миллионов токенов. На бумаге это звучит как почти неограниченный размер. На практике разработчик загружает файл размером в мегабайты и получает ошибку того, что входные данные слишком большие.
Причина не в самой длине окна, а в том, как считаются токены. Разные провайдеры используют разные токенизаторы. Один мегабайт русского текста может быть разным объёмом в токенах в зависимости от алгоритма.
Как узнать реальный лимит
Документация часто не уточняет этот момент, и разработчик узнаёт реальное ограничение после первого отказа. Чтобы избежать этого, нужно самому запустить токенизацию на образце данных и вычислить реальный предел.
Часть провайдеров добавили в ответ размер входного и выходного потока в токенах. Это позволяет разработчику обкатать размер локально перед боевым использованием.
Странно, что фраза «максимум 200 тысяч токенов в запросе» ещё не стала стандартной в документации, но постепенно эта точность распространяется.