-
OpenAI выпускает GPT-6 Astra — свою самую умную и выровненную модель
OpenAI
models-llm
-
LLMRouter: единая инфраструктура для разработки, оценки и развёртывания LLM-роутеров
University of Illinois at Urbana-Champaign
research
-
ARC Prize показывает: результат GPT-6 Astra в 99,9% на ARC-AGI-3 получен благодаря кастомному harness OpenAI, а не самой модели
OpenAI
research
-
Long-Horizon-Terminal-Bench: тестирование пределов агентов на длинных терминальных задачах
Tencent Hunyuan
research
-
Specific выпустила бенчмарк Real-SWE на задачах из приватных корпоративных кодовых баз
Specific
tools
-
The Tasteful Agent: измерение «вкуса» в задачах длинного горизонта
Microsoft
research
-
Demystifying Agent Skills: почему они работают — пока не перестают
UC San Diego (Zhiyuan Jiang, Mengdi Wang, Yijiang Li et al.)
research
-
EnvHarness: Awakening Static Worlds for Agent Learning
Google
research
-
K12-KGraph: граф знаний, привязанный к учебной программе, для бенчмаркинга и обучения образовательных LLM
research
-
VibeWorlding: могут ли мультимодальные агенты создавать 3D-открытые миры от начала до конца?
Tencent
research
-
HarnessEval-W: агентное превращение оценки визуальных миров
NTU / MirroS-Lab consortium
research
-
SWE-bench Science: могут ли кодинг-агенты решать инженерные задачи в науке?
OpenMOSS
research
-
Benchmark Radar: живая база данных и поисковая система по ИИ-бенчмаркам
Carnegie Mellon University
research
-
RecreationWorld: масштабируемые и верифицируемые окружения для гибридных computer-use-агентов
Qwen (Alibaba)
research
-
IdeaGene-Bench: бенчмарк для рассуждений о научной родословной и генерации идей
Shanghai Jiao Tong University
research
-
ASI-Bench: на заре искусственного суперинтеллекта
42-author consortium (lead: Junwei Zhou; incl. Chi Wang, Yilun Hao, Yuantao Zhai)
research
-
Last Translation Benchmark: авторские задачи людей, которые всё ещё ломают frontier-модели перевода
research
-
SpatialBlock: обучение LVLM пространственному мышлению на синтетике с блоками
KAIST AI
research
-
MWS AI выпускает Cotype Pro 3 (27B) и Light 3 (9B) для корпоративных ИИ-агентов
MWS AI
models-llm