Публичные рейтинги моделей плохо предсказывают пользу в работе

Каждый выход новой версии сопровождается таблицами сравнений, и они мало помогают при выборе. Наборы задач в таких таблицах устроены иначе, чем повседневная работа, и модель, выигравшая пару пунктов на тесте, может уступать на конкретных сценариях.

Дополнительная сложность — насыщение. На части популярных наборов результаты подобрались к потолку, и различия в единицы процентов перестали означать что-то содержательное.

Свой набор проверок

Практика, которая приживается, — собственный список из полутора десятков реальных задач с известным правильным ответом. Прогон занимает вечер, но даёт основание для выбора, которого не даёт ни один публичный рейтинг.

Важное условие — фиксировать не только ответы, но и условия: версия, режим рассуждения, наличие памяти. Без этого сравнение через полгода превращается в спор об ощущениях.

Что это значит

Подробности и первичное описание опубликованы на странице как удержать одного персонажа в серии картинок, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Модели и обновления ChatGPT — он пополняется по мере выхода новых сообщений.