Инференс-оптимизированные форматы упали в цене, облачные API нет
За два года стоимость квантизации и оптимизации весов упала в пять раз благодаря автоматизации. Форматы вроде GGUF и ONNX теперь генерируются за часы, а облачные сервисы вроде Hugging Face предлагают их бесплатно или за копейки. При этом цены на облачное API от больших моделей не упали и даже выросли.
Экономика переломилась в пользу локального запуска: если использовать модель регулярно, уже на тысяче токенов дешевле скачать оптимизированные веса и крутить их у себя, чем платить за каждый запрос. Раньше это был выбор для энтузиастов, теперь это выбор для бизнеса.
Следствия для облачных провайдеров
OpenAI и Anthropic тихо снижают доступность бесплатных уровней, а стартапы вроде Together и Modal начинают позиционировать себя как чистая инфраструктура, а не монополисты на модели. Облачные сервисы теперь конкурируют не ценой, а скоростью и интеграциями.
На практике компании начинают смешанный подход: тяжёлые задачи на локальных весах, тонкая доработка и специальные кейсы через облако. Это снижает счета примерно на треть при сохранении гибкости.
Расхождение в экономике локального и облачного запуска ускорит миграцию на открытые модели. Закрытые API останутся востребованы для высоконагруженных сервисов и специализированных моделей, а типовые задачи будут решаться дома.