Токсичность в выводах ИИ: исследование независимых лабораторий

Коллаборация независимых лабораторий провела систематическое тестирование ведущих языковых моделей на предмет токсичности и предубеждений в выводах. Исследование охватило более ста сценариев, имитирующих реальные случаи использования в чувствительных областях.

Результаты показали, что даже модели с встроенными механизмами фильтрации могут генерировать вредоносный или дискриминационный контент при определённых условиях промптинга. Проблема проявляется особенно заметно при работе с меньшинствами и социально уязвимыми группами.

Методология и выводы

Исследователи разработали стандартизированный набор тестов для оценки безопасности моделей, который может быть использован разработчиками и регуляторами.

Авторы отчёта рекомендуют более строгий контроль на этапе обучения и внедрение независимых аудитов перед развёртыванием моделей в production.

Результаты исследования уже привлекли внимание европейских регуляторов и крупных технологических компаний, пересматривающих свои процессы оценки безопасности.