Очистка датасета: как исключить копирайтные изображения из обучения модели

Компания-разработчик нейросетей представила фильтр, сравнивающий изображения из обучающей выборки с реестрами авторских работ и произведений искусства. Система использует глубокие хэши и перцептивный поиск для выявления похожих работ независимо от размера и формата.

Фильтр прошёл испытание на датасете в два миллиарда изображений. Разработчики удалили более 300 миллионов элементов, связанных с защищённым контентом известных художников и фотографов.

Внедрение и стандартизация

Новый инструмент позволяет компаниям лицензировать датасеты с меньшими правовыми рисками. Художники получают возможность добавить свои работы в чёрные списки перед обучением моделей.

Несколько крупных издателей и ассоциаций авторов уже согласились на интеграцию своих реестров с системой очистки. Запросы художников на исключение их произведений обрабатываются в течение недели.

Однако полная очистка остаётся невозможной: незарегистрированные и забытые работы, а также контент в открытых доменах по-прежнему остаются в датасетах. Разработчики называют метод частичным решением комплексной проблемы.