EvoSafeHarness: автоматически эволюционирующие safety-харнессы для LLM-агентов
Фреймворк, синтезирующий специфичные для развёртывания safety-харнессы агентов — совместный поиск политики на естественном языке и исполняемой логики принуждения — для замороженной модели в целевом домене. На AgentDojo достигает 82,8% utility при 0% attack success rate — примерно вдвое выше utility CaMeL в той же рабочей точке — и переносится без изменений на незнакомые наборы.
Почему это важно
Показывает, что универсальные защиты агентов — узкое место: поиск харнесса под конкретную модель и домен примерно удваивает безопасную utility
Важность: 2/5
Заметная статья по безопасности агентов с сильными результатами на AgentDojo