Проект
О проекте
О проекте
О проекте
LLM-агенты получают доступ к корпоративным данным, почте, документам и внешним сервисам. Ошибка в такой системе может привести не просто к некорректному ответу, а к утечке информации, изменению данных или выполнению нежелательных действий.
Чтобы безопасно развивать агентные решения, бизнесу нужна методология , которая позволяла бы контролировать и измерять уровень безопасности агента после каждого его обновления: модели, системного промпта или подключенных инструментов.
РЕШЕНИЕ
РЕШЕНИЕ
РЕШЕНИЕ
Мы разработали методологию Red Teaming для LLM-агента клиента и создали датасет верифицированных атакующих сценариев для автоматизированного тестирования.
Основой стали реальные логи взаимодействия пользователей с агентом, которые прошли анонимизацию и анализ экспертами. На их базе сформировали сценарии атак, имитирующие реальные угрозы: промпт-инъекции, утечку внутренних данных, подмену информации и мошеннические сценарии.
Для каждого тест-кейса определили формальные критерии успешной атаки: проанализировали не только финальный ответ модели, но и цепочку вызовов инструментов, параметры запросов и доступ к данным. Такой подход позволил оценивать поведение агента на уровне его действий, а не только текстового ответа.

РЕЗУЛЬТАТ
РЕЗУЛЬТАТ
РЕЗУЛЬТАТ
Клиент получил внутренний бенчмарк безопасности, адаптированный под собственный стек, бизнес-процессы и сценарии использования AI-агента.
Датасет включает сценарии как с успешными атаками, так и с корректным поведением системы, поэтому его можно использовать для регрессионного тестирования новых версий агента. После интеграции с Promptfoo проверка безопасности стала частью CI-процесса: изменения в системном промпте, базе знаний или инструментах автоматически проходят проверку на появление новых уязвимостей.
РЕАЛИЗАЦИЯ
РЕАЛИЗАЦИЯ
РЕАЛИЗАЦИЯ
Для подготовки бенчмарка использовали комбинацию автоматической генерации сценариев и экспертной валидации.
AI-тренеры модифицировали реальные пользовательские запросы и постепенно усложняли их, создавая многошаговые диалоги, в которых модель могла допустить ошибку через несколько взаимодействий. Каждый сценарий проверялся в изолированном окружении с фиксированным набором инструментов и данных.
В процессе тестирования анализировали несколько типов ошибок: некорректные вызовы MCP-инструментов, передачу конфиденциальных данных, изменение информации на основе недостоверных источников и другие нарушения политик безопасности.
Для автоматизации регрессионного тестирования подготовили структуру тест-кейсов, совместимую с Promptfoo и моделью-судьей (LLM-as-a-Judge), что позволило встроить проверки безопасности в существующий CI/CD-процесс.







