HarnessEval-W: агентное превращение оценки визуальных миров

NTU / MirroS-Lab consortium

исследования офиц. + СМИ 2 ист. ~1 мин

Заменяет brute-force скалярные метрики для развёртываний world-model агентным конвейером: родительский агент разбивает каждую оценку на подзадачи, порождает специализированных сабагентов с адаптированным контекстом и диагностическими инструментами, затем валидирует и суммирует дерево доказательств. Применённый к 18 world-моделям на 330 случаях, его вердикты согласуются с человеческими предпочтениями, одновременно раскрывая посылочное рассуждение для каждого развёртывания.

Почему это важно

HF: 30 голосов. Первый бенчмарк world-моделей, который поставляет верифицируемую цепочку рассуждений вместе с оценкой.

Важность: 2/5

HF Daily 30 upvotes

Источники

официальный arXiv:2608.16859