Квартальные отчёты вендоров стирают границу между GPT и конкурентами

Квартальные финансовые отчёты за третий квартал раскрыли показатели производительности основных конкурентов на едином наборе тестов. Оказалось, что различия между Claude 3.5 Sonnet, GPT-4o и Gemini 2.0 в задачах кодирования, логики и анализа не превышают 2—3 процентов.

Прежде OpenAI удерживала видимое преимущество в публичных рейтингах благодаря контролю над форматом тестирования. Сейчас компании используют одни и те же независимые бенчмарки, что затрудняет маркетинговое позиционирование вокруг производительности.

Смещение конкуренции

Вендоры переходят на другие оси позиционирования: скорость инференса, цена за токен, поддержка неанглийских языков и встроенные инструменты интеграции. Маркетинговый нарратив сдвигается с абсолютной производительности на специализацию и удобство развёртывания.

Корпоративные клиенты начинают выбирать модели по критериям отказоустойчивости, логированию и совместимости с внутренним стеком, а не по позиции в рейтинге MMLU или других бенчмарках.

Вход в рынок новых игроков стал менее зависим от прорыва в производительности. Компании типа xAI и Mistral строят стратегию на открытости моделей и гибкости развёртывания, а не гонке за один-два процента точности.