#safety
- Claude Fable 5 и Claude Mythos 5: самая мощная модель Anthropic становится публичной Anthropic models-llm
- Правительство США обязало Anthropic отключить Claude Fable 5 и Mythos 5 по всему миру Anthropic industry
- OpenAI представляет семейство GPT-5.6: Sol, Terra и Luna — ограниченный выпуск только для одобренных правительством организаций OpenAI models-llm
- Глобальное рабочее пространство в языковых моделях Anthropic research
- OpenAI представила GPT-Red — внутреннюю модель для автоматизированного red-teaming защиты от prompt-injection OpenAI research
- OpenAI заявила, что предрелизные модели вырвались из тестовой песочницы и взломали Hugging Face OpenAI research
- CEO Anthropic уточняет: компания не выступает против моделей с открытыми весами Anthropic industry
- Anthropic раскрыла три реальных инцидента по итогам оценки кибербезопасности Claude Anthropic research
- Exploration Hacking: LLM можно дообучить для стратегического противодействия RL-обучению research
- Разбор инцидента OpenAI: как RLHF reward hacking встроил гоблинские метафоры в GPT-5.x OpenAI research
- OpenAI раскрывает случайное использование оценки цепочки рассуждений при RL-обучении шести моделей OpenAI research
- OpenAI запускает Daybreak: платформу для обнаружения уязвимостей на базе ИИ OpenAI tools
- Конгресс США опубликовал 269-страничный проект «Great American AI Act» с трёхлетним приоритетом над законами штатов industry
- Сотрудники Anthropic проведут переговоры с Белым домом о приостановке доступа к Fable 5 Anthropic industry
- OpenAI публикует Deployment Simulation: предсказание поведения модели до релиза OpenAI research
- Насколько прозрачна DiffusionGemma? Исследование интерпретируемости сокращает разрыв с авторегрессионными моделями Google DeepMind research
- Anthropic включила бывшего главу ФРС Бена Бернанке в Long-Term Benefit Trust Anthropic industry
- Исследование Anthropic: ценности Claude существенно различаются в зависимости от версии модели и языка Anthropic research
- ElevenLabs внедряет аудиоводяной знак SynthID от Google DeepMind для пользователей бесплатного тарифа ElevenLabs audio
- Google DeepMind и Isomorphic Labs подробно рассказали о совместной инициативе по биоустойчивости Google DeepMind research
- Natural Language Autoencoders: превращение внутренних состояний Claude в текст Anthropic research
- Anthropic представляет Natural Language Autoencoders для масштабируемой интерпретируемости LLM Anthropic research
- Anthropic устраняет агентическое поведение шантажа у Claude с помощью «Teaching Claude Why» Anthropic research
- GRAM: модульное предобучение делает знания двойного назначения физически удаляемыми из AI-моделей AE Studio / Anthropic research
- Model Spec Midtraining: как нормативное самопознание улучшает обобщение alignment Anthropic research
- Вмешательства SAE ненадёжны: подавленное поведение восстанавливается после интервенции Hong Kong Polytechnic University research
- Google DeepMind публикует AI Control Roadmap: эшелонированная защита от рассогласованных агентов кодирования Google DeepMind research
- GateMem: бенчмарк управления памятью в агентах с разделённым доступом research
- SingGuard: адаптируемый к политике во время выполнения мультимодальный защитный барьер LLM с бенчмарком из 56 тыс. примеров inclusionAI research
- Anthropic предлагает отраслевую шкалу оценки тяжести джейлбрейков Anthropic research
- BadWAM: когда модели «мир-действие» правильно мечтают, но неправильно действуют research
- Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами Anthropic research
- Meta публикует отчёт о готовности Code World Model перед выпуском в открытый доступ Meta research
- Google SynthID Reaches 100B+ Watermarked Assets; OpenAI and ElevenLabs Join C2PA Coalition Google DeepMind tools
- Cursor запускает Security Review Beta: сканер уязвимостей в PR и плановые CVE-агенты Cursor tools
- Quantifying Faithful Confidence Expression in Large Reasoning Models Yale NLP research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- Google DeepMind и партнёры запускают исследовательский фонд по безопасности мульти-агентных AI на $10 млн Google DeepMind industry
- Anthropic публикует первый Public Record: опрос 52 000 американцев об отношении к AI Anthropic research
- Claude Code v2.1.183: защитные ограничения автоматического режима для деструктивных git- и инфраструктурных команд Anthropic tools
- Институциональный red-teaming: правила развёртывания, а не только веса модели, причинно влияют на безопасность мультиагентных систем research
- Рекурсивное самосовершенствование в ИИ: обзор 1250 статей с таксономией по силе верификации research
- Anthropic запускает публичную инициативу подотчётности «Сложные вопросы» Anthropic industry
- Метапознание в больших языковых моделях: основы, прогресс и возможности — обзор Yale NLP Yale NLP Lab research
- AISPA: пользователецентричный аудит системных промптов для приложений на больших языковых моделях Stanford University research
- Защитные механизмы на основе копируемого контекста не могут обеспечить надёжную безопасность LLM research
- LLM Safety From Within (SIREN) University of Toronto CSSLab / McGill / LMU Munich research
- Яндекс распространяет сертификацию безопасности ИИ ISO/IEC 42001 на всё семейство моделей Alice AI Yandex industry