EvoSafeHarness: автоматически эволюционирующие safety-харнессы для LLM-агентов

исследования официальный 1 ист. ~1 мин

Фреймворк, синтезирующий специфичные для развёртывания safety-харнессы агентов — совместный поиск политики на естественном языке и исполняемой логики принуждения — для замороженной модели в целевом домене. На AgentDojo достигает 82,8% utility при 0% attack success rate — примерно вдвое выше utility CaMeL в той же рабочей точке — и переносится без изменений на незнакомые наборы.

Почему это важно

Показывает, что универсальные защиты агентов — узкое место: поиск харнесса под конкретную модель и домен примерно удваивает безопасную utility

Важность: 2/5

Заметная статья по безопасности агентов с сильными результатами на AgentDojo

Источники