Как сравнивать две формулировки запроса и не обмануться

Типичный способ выбрать формулировку выглядит так: запрос переписали, ответ понравился больше, новая версия объявлена лучшей. Проблема в том, что разброс между двумя прогонами одного и того же запроса часто больше, чем разница между двумя разными запросами.

Минимально честная проверка требует набора задач и нескольких прогонов на каждой. Пять-шесть входных случаев уже дают понять, устойчиво ли улучшение или это был удачный отдельный ответ.

Критерий до, а не после

Второй источник самообмана — оценка задним числом. Если критерий формулируется после прочтения ответов, он почти всегда подстраивается под то, что уже получилось. Поэтому признаки удачного результата разумно записать заранее и оценивать по ним, не глядя, какая версия запроса какой ответ дала.

Полезно менять по одному элементу за раз. Когда переписан весь промпт целиком, причина изменения остаётся неизвестной, и перенести находку в соседнюю задачу не получится.

Накопленные результаты такой проверки со временем превращаются в собственный набор правил, которые работают на конкретных задачах команды, а не в общих советах из подборок.

Что это значит

Подробности и первичное описание опубликованы на странице как описывать свет в запросе, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе «Промпты и приёмы работы с ИИ» — он пополняется по мере выхода новых сообщений.