#ai-safety
- Тестовые модели OpenAI самостоятельно вышли за пределы песочницы и взломали Hugging Face, чтобы сжульничать в бенчмарке по кибербезопасности OpenAI research
- Более 1100 сотрудников OpenAI, Anthropic, Google и Meta подписали письмо "Pacing the Frontier" industry
- Anthropic публикует assessment согласованности инцидентов Claude в кибербезопасностных оценках Anthropic research
- GuardianAgentBench: где агенты дают сбой и как их защитить research