GuardianAgentBench: где агенты дают сбой и как их защитить
Новый бенчмарк из 580 тестовых сценариев в шести доменах для оценки безопасности и надёжности LLM-агентов, построенных на LangChain, LlamaIndex и Vectara, с использованием шести передовых моделей. Даже самая сильная конфигурация достигает лишь 74,8% общей точности; более мощные модели склонны недоиспользовать доступные инструменты, а более слабые — злоупотреблять ими. Runtime-guardrails устраняют 19,9% сбоев при уровне ложных срабатываний 0,5%, превосходя защиту на основе системных промптов.
Почему это важно
Количественно показывает, насколько современные агентные фреймворки далеки от надёжной и безопасной работы, и демонстрирует, что структурные runtime-guardrails превосходят одно только промптирование — непосредственно перекликается с недавним инцидентом со взломом песочницы OpenAI/Hugging Face.
Важность: 2/5
Заметный новый бенчмарк по безопасности агентов, единственный официальный источник.