GuardianAgentBench: где агенты дают сбой и как их защитить

исследования официальный 1 ист. ~1 мин

Новый бенчмарк из 580 тестовых сценариев в шести доменах для оценки безопасности и надёжности LLM-агентов, построенных на LangChain, LlamaIndex и Vectara, с использованием шести передовых моделей. Даже самая сильная конфигурация достигает лишь 74,8% общей точности; более мощные модели склонны недоиспользовать доступные инструменты, а более слабые — злоупотреблять ими. Runtime-guardrails устраняют 19,9% сбоев при уровне ложных срабатываний 0,5%, превосходя защиту на основе системных промптов.

Почему это важно

Количественно показывает, насколько современные агентные фреймворки далеки от надёжной и безопасной работы, и демонстрирует, что структурные runtime-guardrails превосходят одно только промптирование — непосредственно перекликается с недавним инцидентом со взломом песочницы OpenAI/Hugging Face.

Важность: 2/5

Заметный новый бенчмарк по безопасности агентов, единственный официальный источник.

Источники