Модель научилась отказываться от невозможных задач честно

Антропическая модель нового поколения продемонстрировала способность распознавать задачи, выходящие за границы её компетентности, и честно сообщать об этом вместо попытки дать ошибочный ответ. Отказ сопровождается ясным объяснением, почему задача невыполнима для данной системы.

Система анализирует три класса проблем: задачи, требующие реального взаимодействия с внешним миром (покупка билета, вызов такси), работа с текущей информацией, которой нет в обучающих данных, и просьбы о действиях, нарушающих политику безопасности.

Доверие через осознание границ

Исследование показало, что пользователи доверяют ИИ на 42 процента больше, когда тот честно указывает на свои ограничения, чем когда пытается помочь любой ценой и порой неправильно. Это изменило восприятие агентов в профессиональной среде.

Отказ может быть мягким — агент предлагает альтернативный подход или перенаправляет на человека-специалиста. Жёсткий отказ используется только для задач, которые могут привести к вреду или нарушить политику компании.

Функция внедрена во все коммерческие версии моделей и становится стандартом при разработке безопасных ИИ-систем.