Очистка датасета: как исключить копирайтные изображения из обучения модели
Компания-разработчик нейросетей представила фильтр, сравнивающий изображения из обучающей выборки с реестрами авторских работ и произведений искусства. Система использует глубокие хэши и перцептивный поиск для выявления похожих работ независимо от размера и формата.
Фильтр прошёл испытание на датасете в два миллиарда изображений. Разработчики удалили более 300 миллионов элементов, связанных с защищённым контентом известных художников и фотографов.
Внедрение и стандартизация
Новый инструмент позволяет компаниям лицензировать датасеты с меньшими правовыми рисками. Художники получают возможность добавить свои работы в чёрные списки перед обучением моделей.
Несколько крупных издателей и ассоциаций авторов уже согласились на интеграцию своих реестров с системой очистки. Запросы художников на исключение их произведений обрабатываются в течение недели.
Однако полная очистка остаётся невозможной: незарегистрированные и забытые работы, а также контент в открытых доменах по-прежнему остаются в датасетах. Разработчики называют метод частичным решением комплексной проблемы.