Meta расширила Llama API поддержкой встроенного фильтра небезопасного контента
Meta интегрировала в Llama API автоматический фильтр небезопасного контента, который анализирует входящие запросы и исходящие ответы модели. Система использует специальные классификаторы для выявления потенциально вредоносного или запрещённого содержимого до его генерации.
Фильтр поддерживает настройку уровня строгости: от щадящего режима, который блокирует явно опасный контент, до строгого, который также ограничивает спорные темы. Разработчик может переопределить правила под требования своего приложения.
Прозрачность и контроль
При обнаружении потенциально небезопасного контента система возвращает структурированный ответ с описанием причины блокировки и категорией нарушения. Разработчик может логировать такие случаи для анализа и улучшения промптов.
Meta предоставляет документацию с примерами категорий, которые блокирует фильтр, и механизмами отказа при попытке обхода. Политика не скрывает критерии фильтрации, позволяя разработчикам лучше понимать граничные случаи.
Фильтр работает на стороне сервера и включён по умолчанию; отключить его полностью нельзя, но уровень чувствительности настраивается через параметры API вызова.