Почему модель ответила по-другому при идентичном запросе вчера и сегодня
Есть несколько причин, по которым модель даёт разные ответы на идентичный запрос. Первая и наиболее частая — обновление весов модели. Провайдеры периодически выпускают новые версии с лучшей точностью, и даже при нулевой температуре ответ может слегка измениться. Вторая причина — изменения в системных инструкциях: если администратор провайдера обновил глобальные директивы для всех запросов, это повлияет на результат.
Третья причина — кэширование контекста на уровне провайдера. Некоторые сервисы кэшируют длинные префиксы сообщений для ускорения, но если кэш истёк или был сброшен, модель может использовать слегка другое начальное состояние. Четвёртая причина — техническая: случайные ошибки, сбои, различия в аппаратном обеспечении серверов, обработка одного и того же запроса на разных машинах.
Как отличить ошибку от изменения
Если ответы отличаются систематически (например, всегда на 10 процентов короче или в другом стиле), скорее всего произошло обновление модели или системных инструкций. Если отличия случайны и единичны, вероятно, это нормальная вариативность несмотря на нулевую температуру.
Провайдеры публикуют логи обновлений, поэтому первый шаг при нарушении повторяемости — проверить, выпустили ли они новую версию модели. Второй шаг — убедиться, что seed установлен правильно и поддерживается API конкретного провайдера. Третий — сравнить ответы на контрольный промпт, заложенный в начале проекта для отслеживания дрейфа.
Для критичных применений рекомендуется зафиксировать версию модели, если провайдер это позволяет, или регулярно проверять консистентность на контрольном наборе примеров. Документировать дату и время каждого теста — это поможет скоррелировать изменения с обновлениями провайдера.