Измерение качества моделей превратилось в отдельное ремесло

Доверие к публичным сравнительным тестам заметно снизилось. Разработчики отмечают знакомую проблему: показатели растут, а поведение на реальных задачах меняется непредсказуемо, иногда в худшую сторону.

Причин несколько. Задачи из открытых наборов рано или поздно попадают в обучающие данные, формулировки в тестах редко похожи на настоящие пользовательские запросы, а усреднённая оценка скрывает провалы на важных для конкретной компании случаях.

Собственные наборы проверок

Ответом стали внутренние наборы проверок. Компании собирают сотни реальных примеров со своими правильными ответами и прогоняют через них каждую новую версию модели прежде, чем менять её в продукте.

Такой набор оказывается ценным активом. Он накапливается годами, отражает специфику предметной области и позволяет говорить об обновлении моделей на языке измерений, а не впечатлений.

Побочный итог — появление в командах людей, которые занимаются исключительно оценкой. Роль относительно новая, но её необходимость перестала обсуждаться.

Что это значит

Подробности и первичное описание опубликованы на странице «разбор стилевых формулировок», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Модели и обновления ChatGPT — он пополняется по мере выхода новых сообщений.