Уверенно неправильный ответ: модель не различает знание и предположение
Проблема калибровки — это разница между тем, что модель в статистике данных увидела, и тем, уверена ли она на самом деле. Модель может генерировать убедительный ответ даже для вопроса, на который её никогда не учили.
Это происходит, потому что модель оптимизирована на одно: продолжить текст так, как это выглядит в интернете. В интернете люди тоже часто пишут убедительно, даже когда ошибаются. Модель скопировала стиль, но не истину.
Какой процент ошибок скрывается за маской уверенности
На практике это означает, что проверять нужно не только когда модель явно колеблется, но и когда она звучит авторитетно. Ответ в стиле «эксперт уверено сказал» часто опаснее, чем осторожные объяснения.
Некоторые команды используют дополнительную проверку: просят модель объяснить, откуда она знает информацию, и сами решают, убедителен ли источник. Это медленнее, но ловит галлюцинации.
Улучшение калибровки — это один из центральных вызовов развития моделей. Пока что лучший способ — поверить тому, что модель не знает, больше, чем её собственной уверенности.