Квартальные отчёты вендоров стирают границу между GPT и конкурентами
Квартальные финансовые отчёты за третий квартал раскрыли показатели производительности основных конкурентов на едином наборе тестов. Оказалось, что различия между Claude 3.5 Sonnet, GPT-4o и Gemini 2.0 в задачах кодирования, логики и анализа не превышают 2—3 процентов.
Прежде OpenAI удерживала видимое преимущество в публичных рейтингах благодаря контролю над форматом тестирования. Сейчас компании используют одни и те же независимые бенчмарки, что затрудняет маркетинговое позиционирование вокруг производительности.
Смещение конкуренции
Вендоры переходят на другие оси позиционирования: скорость инференса, цена за токен, поддержка неанглийских языков и встроенные инструменты интеграции. Маркетинговый нарратив сдвигается с абсолютной производительности на специализацию и удобство развёртывания.
Корпоративные клиенты начинают выбирать модели по критериям отказоустойчивости, логированию и совместимости с внутренним стеком, а не по позиции в рейтинге MMLU или других бенчмарках.
Вход в рынок новых игроков стал менее зависим от прорыва в производительности. Компании типа xAI и Mistral строят стратегию на открытости моделей и гибкости развёртывания, а не гонке за один-два процента точности.