#evaluation
- EVA-Bench: сквозной фреймворк для оценки голосовых агентов ServiceNow AI research
- SOOHAK: фронтирные LLM решают сложную математику, но не распознают неразрешимые задачи research
- OpenAI публикует Deployment Simulation: предсказание поведения модели до релиза OpenAI research
- GigaWorld-1: дорожная карта для построения моделей мира для оценки роботизированных политик GigaAI research
- Long-Horizon-Terminal-Bench: тестирование пределов агентов на длинных терминальных задачах Tencent Hunyuan research
- LLM-as-a-Verifier: верификация как независимая ось масштабирования для LLM Stanford University / UC Berkeley / NVIDIA research
- Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам research
- EvoArena: LLM-агенты набирают лишь 40% в динамически изменяющихся средах MIT / NUS / Salesforce research
- WeaveBench: агенты компьютерного использования проваливаются на гибридных задачах GUI+CLI — 41% успешных выполнений Microsoft Research research
- PerceptionRubrics: атомарная рубричная оценка выявляет разрыв в 8% по восприятию между открытыми и закрытыми моделями research
- AutomationBench-AA: независимый бенчмарк из 657 задач для AI-агентов в SaaS-автоматизации Artificial Analysis tools
- AutoResearchBench — бенчмарк автономного поиска научной литературы для AI-агентов BAAI research
- EvoArena: LLM-агенты набирают лишь 39,6% на бенчмарке динамически меняющихся сред MIT research
- FAPO: полностью автономная оптимизация промптов в многошаговых LLM-пайплайнах Cisco Foundation AI research
- AgenticSTS: тестовый стенд с ограниченной памятью для LLM-агентов с длинным горизонтом Alaya Studio research
- EvoPolicyGym: оценка итеративного самосовершенствования RL-политик агентами кодирования University of Macau / CUHK research
- SWE-Together: многоходовой бенчмарк для оценки агентов программирования research
- Ideas Have Genomes: фронтирные LLM набирают лишь 27% на бенчмарке рассуждений о научных родословных Shanghai Jiao Tong University research
- K12-KGraph: граф знаний, привязанный к учебной программе, для бенчмаркинга и обучения образовательных LLM research
- Коллапс предпочтений мультимодального оценщика: кросс-модальное заражение в циклах самоэволюции агентов research
- Формализация латентных мыслей: аксиоматический фреймворк для оценки репрезентаций рассуждений LLM University of British Columbia research
- Улучшит ли масштабирование социальное моделирование с LLM? Исследование 85 моделей Stanford / Columbia / Tsinghua research
- UniClawBench: бенчмарк для проактивных AI-агентов на реальных задачах University of Hong Kong research