Токсичность моделей зависит от языка обучающего набора данных

Учёные проанализировали выходные данные больших языковых моделей, обученных на текстах на разных языках, и обнаружили значительные различия в доле токсичного контента. Токсичность напрямую зависит от того, какой процент оскорбительного материала содержался в исходных данных для обучения модели на каждом языке.

Исследование охватило более двадцати языков и продемонстрировало, что для некоторых из них характерна более высокая концентрация токсичности в интернет-текстах. Модели верно отражают статистику обучающих наборов, но не компенсируют их перекос.

Последствия для многоязычных систем

Результаты указывают на необходимость более тщательной фильтрации и балансировки обучающих данных для языков, где токсичность высока. Простое масштабирование размера обучающего набора может усугубить проблему, если исходные пропорции не скорректированы.

Разработчики должны применять дополнительную постобработку и фильтрацию выходных данных для моделей на языках с высокой исходной токсичностью в интернете. Работа подчёркивает необходимость локализованного подхода к обеспечению безопасности моделей.

Исследование показывает, что качественная работа с данными на этапе подготовки обучающего набора критически важна для получения безопасного и этичного поведения языковых моделей.