Модель научилась отказываться от невозможных задач честно
Антропическая модель нового поколения продемонстрировала способность распознавать задачи, выходящие за границы её компетентности, и честно сообщать об этом вместо попытки дать ошибочный ответ. Отказ сопровождается ясным объяснением, почему задача невыполнима для данной системы.
Система анализирует три класса проблем: задачи, требующие реального взаимодействия с внешним миром (покупка билета, вызов такси), работа с текущей информацией, которой нет в обучающих данных, и просьбы о действиях, нарушающих политику безопасности.
Доверие через осознание границ
Исследование показало, что пользователи доверяют ИИ на 42 процента больше, когда тот честно указывает на свои ограничения, чем когда пытается помочь любой ценой и порой неправильно. Это изменило восприятие агентов в профессиональной среде.
Отказ может быть мягким — агент предлагает альтернативный подход или перенаправляет на человека-специалиста. Жёсткий отказ используется только для задач, которые могут привести к вреду или нарушить политику компании.
Функция внедрена во все коммерческие версии моделей и становится стандартом при разработке безопасных ИИ-систем.