WMRL: масштабирование автоматических research-агентов через world-модели

University of Illinois / NVIDIA

исследования официальный 1 ист. ~1 мин

В статье узким местом масштабирования RL post-training автоматических research-агентов называется исполнение окружения (эксклюзивные песочницы, реальное машинное время), и вместо него предлагается обученная world-модель (WMRL). Две коррекции — Online Debiasing и Inverse-Variance Denoising — устраняют смещённые и зашумлённые награды, которые вносит world-модель, с доказательствами, что обе строго улучшают сходимость. Авторы сообщают об ускорении обучения в 3–4 раза при сопоставимом или лучшем конечном качестве; post-trained агенты 4B и 9B обгоняют open-weight агентов 48B и 120B на held-out бенчмарках, а метод переносится на воплощённые VLA-политики.

Почему это важно

437 апвотов на HuggingFace Daily Papers (10 сентября) — лучшая статья окна; бьёт по стене вычислений на исполнение окружения, которая ограничит масштабирование agent-RL раньше, чем дефицит GPU.

Важность: 4/5

Заметная статья с 437 апвотами на HF Daily (буст за >=100 апвотов)

Источники