-
EVA-Bench: сквозной фреймворк для оценки голосовых агентов
ServiceNow AI
research
-
ARC Prize показывает: результат GPT-6 Astra в 99,9% на ARC-AGI-3 получен благодаря кастомному harness OpenAI, а не самой модели
OpenAI
research
-
SOOHAK: фронтирные LLM решают сложную математику, но не распознают неразрешимые задачи
research
-
OpenAI публикует Deployment Simulation: предсказание поведения модели до релиза
OpenAI
research
-
GigaWorld-1: дорожная карта для построения моделей мира для оценки роботизированных политик
GigaAI
research
-
Long-Horizon-Terminal-Bench: тестирование пределов агентов на длинных терминальных задачах
Tencent Hunyuan
research
-
VGI-Bench: проверка визуального интеллекта в моделях генерации видео
research
-
Specific выпустила бенчмарк Real-SWE на задачах из приватных корпоративных кодовых баз
Specific
tools
-
DataFlex-RL: оценочная платформа показала, что политики отбора данных для RLVR не превосходят равномерный сэмплинг
Peking University
research
-
LLM-as-a-Verifier: верификация как независимая ось масштабирования для LLM
Stanford University / UC Berkeley / NVIDIA
research
-
ClawProBench: trace-aware оценка AI-агентов с покрытием в рантайме
research
-
Repo-To-Skill: дистилляция GitHub-репозиториев в переиспользуемые AI-скиллы
research
-
Random Attention: переосмысление вытеснения KV-кэша для эффективного рассуждения
Salesforce AI Research
research
-
LimiX-2: Contextual Mechanism Network на пути к общему интеллекту на структурированных данных
Stable AI
research
-
Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам
research
-
EvoArena: LLM-агенты набирают лишь 40% в динамически изменяющихся средах
MIT / NUS / Salesforce
research
-
WeaveBench: агенты компьютерного использования проваливаются на гибридных задачах GUI+CLI — 41% успешных выполнений
Microsoft Research
research
-
PerceptionRubrics: атомарная рубричная оценка выявляет разрыв в 8% по восприятию между открытыми и закрытыми моделями
research
-
AutomationBench-AA: независимый бенчмарк из 657 задач для AI-агентов в SaaS-автоматизации
Artificial Analysis
tools
-
OSReward: стандартизированная оценка кросс-платформенных reward-моделей для computer-use
NLP Group of The University of Hong Kong
research
-
Cline открывает исходники оценок на основе Terminal-Bench для open-weight кодинг-агентов
Cline
tools
-
StudentSim: обучение симуляторов студентов на базе LLM
Microsoft Research
research
-
Читаемость — не интерпретируемость: оценённая против реальной важности шагов в chain-of-thought
research
-
AutoResearchBench — бенчмарк автономного поиска научной литературы для AI-агентов
BAAI
research
-
EvoArena: LLM-агенты набирают лишь 39,6% на бенчмарке динамически меняющихся сред
MIT
research
-
FAPO: полностью автономная оптимизация промптов в многошаговых LLM-пайплайнах
Cisco Foundation AI
research
-
AgenticSTS: тестовый стенд с ограниченной памятью для LLM-агентов с длинным горизонтом
Alaya Studio
research
-
EvoPolicyGym: оценка итеративного самосовершенствования RL-политик агентами кодирования
University of Macau / CUHK
research
-
SWE-Together: многоходовой бенчмарк для оценки агентов программирования
research
-
Ideas Have Genomes: фронтирные LLM набирают лишь 27% на бенчмарке рассуждений о научных родословных
Shanghai Jiao Tong University
research
-
K12-KGraph: граф знаний, привязанный к учебной программе, для бенчмаркинга и обучения образовательных LLM
research
-
Как риторика может взломать оценки ИИ-ревьюеров? Разбор риторической чувствительности ИИ-систем научного рецензирования
research
-
HarnessEval-W: агентное превращение оценки визуальных миров
NTU / MirroS-Lab consortium
research
-
PAWBench: как далеко мы от вероятностно согласованного world-моделирования?
research
-
Benchmark Radar: живая база данных и поисковая система по ИИ-бенчмаркам
Carnegie Mellon University
research
-
Коллапс предпочтений мультимодального оценщика: кросс-модальное заражение в циклах самоэволюции агентов
research
-
Формализация латентных мыслей: аксиоматический фреймворк для оценки репрезентаций рассуждений LLM
University of British Columbia
research
-
Улучшит ли масштабирование социальное моделирование с LLM? Исследование 85 моделей
Stanford / Columbia / Tsinghua
research
-
UniClawBench: бенчмарк для проактивных AI-агентов на реальных задачах
University of Hong Kong
research
-
OSReward тестирует кросс-платформенные модели вознаграждения для computer-use
University of Hong Kong
research
-
IBM Research измеряет, сколько агентской памяти реально нужно каждому ярусу моделей
IBM Research
research
-
FrontierChallenge: оценка выполнения научных workflow
HKU + Apodex AI
research
-
xAI опубликовала оценку биобезопасности Grok 4.6 от LatchBio
xAI
research
-
LoopArena: бенчмаркинг моделей как рантайм-контроллеров для loop engineering
research
-
Last Translation Benchmark: авторские задачи людей, которые всё ещё ломают frontier-модели перевода
research
-
RealSWE: бенчмарк кодинг-агентов, перестроенный вокруг реальных, небрежных пользовательских запросов
research
-
Enoki: многоуровневое детектирование галлюцинаций из одного open IE-конвейера
Skoltech
research
-
Эмпирическое исследование дизайна харнессов для кодинг-агентов
Zoom
research