Компания Anthropic опубликовала отчет об этике развития больших моделей

Anthropic, создатель модели Claude, опубликовала официальный документ о подходе компании к этическому развитию искусственного интеллекта. Отчёт охватывает вопросы безопасности, управления рисками, предотвращения неправомерного использования и отчётности перед общественностью.

В документе описаны методы, использованные при обучении моделей, включая технику reinforcement learning from human feedback для выравнивания поведения ИИ с человеческими ценностями. Компания также определила ключевые области потенциального ущерба и способы их минимизации.

Прозрачность и стандарты

Anthropic призывает индустрию к принятию единых стандартов оценки и отчётности о рисках больших моделей. Компания делится результатами своих исследований и рекомендует коллегам применять аналогичные подходы к безопасности.

Отчёт включает обзор внешних аудитов модели Claude и рекомендации для регуляторов по установлению обязательных требований к разработчикам ИИ. Anthropic также объявила о формировании консультативного совета из экспертов в области права, этики и безопасности.

Публикация подчёркивает растущее давление на компании ИИ с целью повысить прозрачность своих разработок и взять на себя ответственность за потенциальные социальные последствия внедрения больших моделей.