Измерение качества моделей превратилось в отдельное ремесло
Доверие к публичным сравнительным тестам заметно снизилось. Разработчики отмечают знакомую проблему: показатели растут, а поведение на реальных задачах меняется непредсказуемо, иногда в худшую сторону.
Причин несколько. Задачи из открытых наборов рано или поздно попадают в обучающие данные, формулировки в тестах редко похожи на настоящие пользовательские запросы, а усреднённая оценка скрывает провалы на важных для конкретной компании случаях.
Собственные наборы проверок
Ответом стали внутренние наборы проверок. Компании собирают сотни реальных примеров со своими правильными ответами и прогоняют через них каждую новую версию модели прежде, чем менять её в продукте.
Такой набор оказывается ценным активом. Он накапливается годами, отражает специфику предметной области и позволяет говорить об обновлении моделей на языке измерений, а не впечатлений.
Побочный итог — появление в командах людей, которые занимаются исключительно оценкой. Роль относительно новая, но её необходимость перестала обсуждаться.
Что это значит
Подробности и первичное описание опубликованы на странице «разбор стилевых формулировок», там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Модели и обновления ChatGPT — он пополняется по мере выхода новых сообщений.