Публичные рейтинги моделей плохо предсказывают локальный результат

Выбор открытой модели часто начинается с публичных таблиц сравнения. Проблема в том, что такие таблицы измеряют усреднённое поведение на общих наборах задач, а внедряют модель всегда во что-то узкое.

К этому добавляется давняя болезнь публичных наборов: они попадают в обучающие данные. Модель может демонстрировать отличный результат на известном тесте и заметно проседать на похожей, но невиданной раньше задаче.

Как выглядит честная проверка

Практики советуют собрать полсотни собственных примеров с эталонными ответами и прогонять через них каждую модель-кандидата. Это скучная работа на день, которая экономит недели на попытках понять, почему в продакшене всё иначе.

Такой набор полезен и потом. Он превращается в регрессионный тест: при переходе на новую версию весов или более агрессивную квантизацию сразу видно, что именно испортилось, а не общее ощущение «стало хуже».

Вывод, который повторяют регулярно: рейтинги годятся, чтобы сузить список кандидатов до нескольких, но окончательное решение всегда принимается на своих данных.

Что это значит

Подробности и первичное описание опубликованы на странице «что делать, когда генератор не отвечает», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Открытые модели и локальный запуск — он пополняется по мере выхода новых сообщений.