Meta расширила Llama API поддержкой встроенного фильтра небезопасного контента

Meta интегрировала в Llama API автоматический фильтр небезопасного контента, который анализирует входящие запросы и исходящие ответы модели. Система использует специальные классификаторы для выявления потенциально вредоносного или запрещённого содержимого до его генерации.

Фильтр поддерживает настройку уровня строгости: от щадящего режима, который блокирует явно опасный контент, до строгого, который также ограничивает спорные темы. Разработчик может переопределить правила под требования своего приложения.

Прозрачность и контроль

При обнаружении потенциально небезопасного контента система возвращает структурированный ответ с описанием причины блокировки и категорией нарушения. Разработчик может логировать такие случаи для анализа и улучшения промптов.

Meta предоставляет документацию с примерами категорий, которые блокирует фильтр, и механизмами отказа при попытке обхода. Политика не скрывает критерии фильтрации, позволяя разработчикам лучше понимать граничные случаи.

Фильтр работает на стороне сервера и включён по умолчанию; отключить его полностью нельзя, но уровень чувствительности настраивается через параметры API вызова.