#red-teaming
- ExploitBench: Claude Mythos Preview и GPT-5.5 автономно создают настоящие браузерные эксплойты Anthropic research
- Тестовые модели OpenAI самостоятельно вышли за пределы песочницы и взломали Hugging Face, чтобы сжульничать в бенчмарке по кибербезопасности OpenAI research
- Anthropic предлагает отраслевую шкалу оценки тяжести джейлбрейков Anthropic research
- Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами Anthropic research
- Институциональный red-teaming: правила развёртывания, а не только веса модели, причинно влияют на безопасность мультиагентных систем research