-
Microsoft Build 2026: запуск семейства моделей MAI для GitHub Copilot без зависимости от OpenAI
Microsoft
models-llm
-
xAI выпустила Grok 4.3 с контекстом 1M токенов, снижением цен на 40–60% и улучшенными результатами в агентных бенчмарках
xAI
models-llm
-
SenseNova-U1: open-source унифицированное мультимодальное понимание и генерация через NEO-unify
SenseTime
research
-
MulTaBench: бенчмаркинг мультимодального табличного обучения с текстом и изображениями
Technion
research
-
EVA-Bench: сквозной фреймворк для оценки голосовых агентов
ServiceNow AI
research
-
ExploitBench: Claude Mythos Preview и GPT-5.5 автономно создают настоящие браузерные эксплойты
Anthropic
research
-
VibeThinker-3B достигает показателей frontier-уровня на бенчмарках рассуждений через curriculum RL
WeiboAI
research
-
AI Co-Mathematician от Google DeepMind достигает 48% на FrontierMath Tier 4
Google DeepMind
research
-
Baidu выпускает ERNIE 5.1 при 6% отраслевых затрат на предобучение и входит в мировой топ-10 поиска
Baidu
models-llm
-
RubricEM: мета-RL с декомпозицией политики под руководством рубрик за пределами верифицируемых наград
Google
research
-
SOOHAK: фронтирные LLM решают сложную математику, но не распознают неразрешимые задачи
research
-
ENPIRE: агенты кодирования ИИ замыкают цикл физических робототехнических исследований без участия человека
NVIDIA / Carnegie Mellon University / UC Berkeley
research
-
JetSpec: преодоление потолка масштабирования спекулятивного декодирования с помощью параллельного построения деревьев черновиков
Hao AI Lab, UC San Diego
research
-
OpenAI выпускает GeneBench-Pro — передовой бенчмарк для AI-агентов в биологии
OpenAI
research
-
LingBot-VLA 2.0: преодоление разрыва между базовыми VLA-моделями и реальным развёртыванием
LingBot Team
research
-
ByteDance EdgeBench: скорость обучения агентов удваивается каждые три месяца
ByteDance
research
-
HumanCLAW: способны ли vision-language модели действовать через тело?
Meta Research
research
-
DeepSeek открыл публичный бета-доступ к API V4-Flash-0731, обошедшему собственный флагман на агентных бенчмарках
DeepSeek
models-llm
-
MaxProof: модель MiniMax превышает пороги золотых медалей IMO и USAMO в формальной математике
MiniMax
research
-
Mistral выпускает Leanstral 1.5: открытая модель формальной верификации для Lean 4
Mistral
research
-
LLM-as-a-Verifier: верификация как независимая ось масштабирования для LLM
Stanford University / UC Berkeley / NVIDIA
research
-
AI Co-Mathematician: Google DeepMind достигает 48% на FrontierMath Tier 4
Google DeepMind
research
-
MemLens: бенчмарк мультимодальной долгосрочной памяти для моделей визуального языка
NVIDIA
research
-
Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам
research
-
CiteVQA: бенчмарк атрибуции доказательств для надёжной document intelligence (178 апвоутов на HF)
Peking University / Shanghai Artificial Intelligence Laboratory
research
-
MMSkills: переиспользуемые мультимодальные скиллы для универсальных визуальных агентов (105 апвоутов на HF)
Shanghai Jiao Tong University
research
-
Crafter: мультиагентный фреймворк для генерации редактируемых научных иллюстраций — +16 пунктов над базовыми моделями (103 апвоута на HF)
Tsinghua University
research
-
EvoArena: LLM-агенты набирают лишь 40% в динамически изменяющихся средах
MIT / NUS / Salesforce
research
-
WeaveBench: агенты компьютерного использования проваливаются на гибридных задачах GUI+CLI — 41% успешных выполнений
Microsoft Research
research
-
Исследование Anthropic: успех в агентном программировании определяется экспертизой в предметной области, а не навыками программирования
Anthropic
research
-
GateMem: бенчмарк управления памятью в агентах с разделённым доступом
research
-
Детерминированный горизонт: когда расширенное рассуждение даёт сбой и необходима делегация инструментам
research
-
SingGuard: адаптируемый к политике во время выполнения мультимодальный защитный барьер LLM с бенчмарком из 56 тыс. примеров
inclusionAI
research
-
PerceptionRubrics: атомарная рубричная оценка выявляет разрыв в 8% по восприятию между открытыми и закрытыми моделями
research
-
AutomationBench-AA: независимый бенчмарк из 657 задач для AI-агентов в SaaS-автоматизации
Artificial Analysis
tools
-
Super Weights в LLM: почему высокосалиентные параметры не работают как цели дообучения
Amazon
research
-
ABot-AgentOS: операционная система для роботизированных агентов с долгосрочной мультимодальной памятью
Alibaba
research
-
Beyond Euclidean Clipping: преодоление коллапса исследования в LLM RL через риманову изометрическую оптимизацию политики
research
-
Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами
Anthropic
research
-
Programming with Data: test-driven data engineering для самоулучшающихся LLM
OpenDataLab
research
-
AutoResearchBench — бенчмарк автономного поиска научной литературы для AI-агентов
BAAI
research
-
GigaChat сдаёт инженерную аттестацию в Московском энергетическом институте
Sber
industry
-
Soohak: 64 математика создали исследовательский бенчмарк, который ставит frontier LLM в тупик
Seoul National University
research
-
EvoArena: LLM-агенты набирают лишь 39,6% на бенчмарке динамически меняющихся сред
MIT
research
-
Готовы ли мы к агент-нативным системам памяти? SJTU сравнивает 12 архитектур
research
-
AgenticSTS: тестовый стенд с ограниченной памятью для LLM-агентов с длинным горизонтом
Alaya Studio
research
-
EvoPolicyGym: оценка итеративного самосовершенствования RL-политик агентами кодирования
University of Macau / CUHK
research
-
SWE-Together: многоходовой бенчмарк для оценки агентов программирования
research
-
Ideas Have Genomes: фронтирные LLM набирают лишь 27% на бенчмарке рассуждений о научных родословных
Shanghai Jiao Tong University
research
-
Исполняемые мировые модели для ARC-AGI-3: подход агента программирования без игровой специфики
research
-
Learning, Fast and Slow: двойная весовая архитектура для непрерывной адаптации LLM
research
-
SubtleMemory: бенчмарк выявляет систематические провалы агентов в тонком реляционном запоминании
research
-
VideoKR: обучающий корпус из 315K примеров для знание- и рассуждение-интенсивного понимания видео
Yale University
research
-
SWE-Explore: бенчмарк, выявляющий исследование репозитория как ключевое ограничение в агентах для написания кода
Shanghai Jiao Tong University
research
-
StylisticBias: 15 визуальных атрибутов объясняют 80% социальных предубеждений в мультимодальных LLM
research
-
Улучшит ли масштабирование социальное моделирование с LLM? Исследование 85 моделей
Stanford / Columbia / Tsinghua
research
-
UniClawBench: бенчмарк для проактивных AI-агентов на реальных задачах
University of Hong Kong
research
-
AdvancedMathBench: набор бенчмарков для генерации и верификации математических доказательств
InternLM
research
-
GuardianAgentBench: где агенты дают сбой и как их защитить
research
-
LLM теряются при изменении намерений пользователя
Microsoft Research
research