Наборы проверок пришли на смену оценке качества на глаз

Пока ИИ-функция маленькая, её качество оценивают вручную: поменяли промпт, попробовали пару примеров, стало вроде лучше. Такой способ перестаёт работать ровно тогда, когда изменение начинает улучшать одно и ломать другое незаметно.

Выход — собственный набор проверок из реальных случаев, желательно включающий те, на которых система уже ошибалась. Полсотни примеров с ожидаемыми результатами дают больше, чем любые внешние рейтинги моделей, потому что измеряют вашу задачу, а не среднюю.

Чем измерять неточные ответы

Основная трудность — критерий. Точное совпадение годится для классификации и извлечения полей, но бесполезно для свободного текста. Здесь применяют проверку по признакам: содержит ли ответ обязательные элементы, соблюдён ли формат, нет ли запрещённых утверждений.

Отдельная практика — модель в роли судьи. Она удобна и масштабируема, но требует собственной калибровки: расхождения оценок судьи с человеческими нужно периодически измерять, иначе метрика начинает жить своей жизнью и уверенно показывает рост там, где его нет.

Что это значит

Подробности и первичное описание опубликованы на странице «разбор частых сбоев генерации и их причин», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе ИИ-агенты и автоматизация — он пополняется по мере выхода новых сообщений.