Хакеры нашли уязвимость в системе безопасности популярных языковых моделей
Группа исследователей в области безопасности обнаружила уязвимость в механизмах защиты, которые используются в популярных языковых моделях, включая GPT-подобные системы. Техника эксплуатации основана на манипуляции контекстным окном и позволяет получить доступ к защищённым данным или вызвать нежелательное поведение модели.
Обнаруженный способ атаки требует глубокого понимания архитектуры модели, но при наличии определённых знаний может быть реализован сравнительно быстро. Исследователи отметили, что уязвимость влияет на безопасность взаимодействия с моделью при обработке конфиденциальной информации.
Реакция разработчиков
OpenAI, Anthropic и другие компании-разработчики языковых моделей уже получили отчёты об уязвимости и начали работу над патчами. Внедрение исправлений планируется завершить в течение 1-2 недель.
Эксперты рекомендуют пользователям воздерживаться от обработки критически важных данных через публичные интерфейсы моделей до выпуска обновлений безопасности. Данный инцидент подчёркивает необходимость проведения независимых аудитов безопасности языковых моделей.
Анализ показывает, что уязвимость может существовать и в других популярных ИИ-системах, что требует комплексного пересмотра подходов к защите данных в нейросетевых приложениях.