Публичные рейтинги моделей плохо предсказывают пользу в работе
Каждый выход новой версии сопровождается таблицами сравнений, и они мало помогают при выборе. Наборы задач в таких таблицах устроены иначе, чем повседневная работа, и модель, выигравшая пару пунктов на тесте, может уступать на конкретных сценариях.
Дополнительная сложность — насыщение. На части популярных наборов результаты подобрались к потолку, и различия в единицы процентов перестали означать что-то содержательное.
Свой набор проверок
Практика, которая приживается, — собственный список из полутора десятков реальных задач с известным правильным ответом. Прогон занимает вечер, но даёт основание для выбора, которого не даёт ни один публичный рейтинг.
Важное условие — фиксировать не только ответы, но и условия: версия, режим рассуждения, наличие памяти. Без этого сравнение через полгода превращается в спор об ощущениях.
Что это значит
Подробности и первичное описание опубликованы на странице как удержать одного персонажа в серии картинок, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Модели и обновления ChatGPT — он пополняется по мере выхода новых сообщений.