Hugging Face выпустила библиотеку для защиты от injection-атак в промптах
Hugging Face выпустила библиотеку для защиты от prompt injection-атак. Инструмент анализирует входящие промпты, выявляет попытки перехвата инструкций и нейтрализует их до передачи в модель.
Prompt injection — актуальная уязвимость для публичных сервисов. Злоумышленник может встроить в промпт команду, которая заставит модель изменить своё поведение, раскрыть защищённые инструкции или выполнить несанкционированные операции.
Как защита работает
Библиотека использует набор правил и моделей для выявления подозрительных паттернов в тексте. Она проверяет синтаксис, семантику и контекст промпта, блокируя явные попытки инъекции.
Защита интегрируется в любое приложение с LLM через простой API. Есть возможность логирования попыток атак и кастомизации правил для специфических используемых случаев.
Библиотека открыта, постоянно обновляется с новыми паттернами атак и уже используется несколькими крупными сервисами.