Повтор результата: что даёт регулировка случайности в параметрах

Каждый токен генерируется из распределения вероятностей, и модель случайно выбирает из неё. Температура (temperature) масштабирует это распределение: низкая температура делает вероятности более острыми, высокая — более размытыми. При temperature=0 модель всегда берёт самый вероятный токен. При temperature=1 оставляет стандартное распределение. При temperature>1 размывает его до равномерного почти что выбора.

Top_p работает иначе: это фильтр, который исключает маловероятные токены до генерации. При top_p=0.9 модель рассматривает только те варианты, которые в сумме дают 90% вероятности. Остальные 10% самых маловероятных токенов просто не рассматриваются.

Что даёт практически

Низкая температура и низкий top_p нужны для фактических задач: подключение данных, программирование, написание инструкций. Высокая температура помогает на творческих задачах, но сходит с ума на вопросах, где требуется точность. Комбинация temperature=0.7 и top_p=0.95 часто называют универсальной, но это миф — всё зависит от задачи.

Повторный запрос с разными параметрами даёт другой результат, даже если всё остальное идентично. Модель не вспоминает прошлые ответы и каждый раз формирует вероятности заново. Это позволяет использовать множественные прогоны для поиска лучшего ответа или отбора вариантов.

Главный побочный эффект низкой температуры — шаблонность. Модель прилипает к наиболее типичным для датасета фразам и часто повторяет себя. Высокая температура генерирует оригинальнее, но неустойчиво. Оптимум ищется эмпирически для каждого типа задач.