Компания Anthropic опубликовала отчет об этике развития больших моделей
Anthropic, создатель модели Claude, опубликовала официальный документ о подходе компании к этическому развитию искусственного интеллекта. Отчёт охватывает вопросы безопасности, управления рисками, предотвращения неправомерного использования и отчётности перед общественностью.
В документе описаны методы, использованные при обучении моделей, включая технику reinforcement learning from human feedback для выравнивания поведения ИИ с человеческими ценностями. Компания также определила ключевые области потенциального ущерба и способы их минимизации.
Прозрачность и стандарты
Anthropic призывает индустрию к принятию единых стандартов оценки и отчётности о рисках больших моделей. Компания делится результатами своих исследований и рекомендует коллегам применять аналогичные подходы к безопасности.
Отчёт включает обзор внешних аудитов модели Claude и рекомендации для регуляторов по установлению обязательных требований к разработчикам ИИ. Anthropic также объявила о формировании консультативного совета из экспертов в области права, этики и безопасности.
Публикация подчёркивает растущее давление на компании ИИ с целью повысить прозрачность своих разработок и взять на себя ответственность за потенциальные социальные последствия внедрения больших моделей.