HarnessEval-W: агентное превращение оценки визуальных миров
NTU / MirroS-Lab consortium
Заменяет brute-force скалярные метрики для развёртываний world-model агентным конвейером: родительский агент разбивает каждую оценку на подзадачи, порождает специализированных сабагентов с адаптированным контекстом и диагностическими инструментами, затем валидирует и суммирует дерево доказательств. Применённый к 18 world-моделям на 330 случаях, его вердикты согласуются с человеческими предпочтениями, одновременно раскрывая посылочное рассуждение для каждого развёртывания.
Почему это важно
HF: 30 голосов. Первый бенчмарк world-моделей, который поставляет верифицируемую цепочку рассуждений вместе с оценкой.
Важность: 2/5
HF Daily 30 upvotes
Источники
официальный
arXiv:2608.16859