AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением

Tsinghua University

исследования официальный 1 ист. ~1 мин

Представляет RL-метод без критика для многошаговых агентных задач, который агрегирует разницу вероятностей учителя и ученика в пошаговые индикаторы и поддерживает байесовское состояние убеждений для распределения заслуги между отдельными решающими шагами, превращая разреженные награды за результат в детализированный сигнал.

Почему это важно

Самая популярная статья на HuggingFace Daily Papers за 2026-08-09 с 87 голосами; заявлен показатель успеха 89.1% на ALFWorld с Qwen2.5-7B, превосходящий существующие базовые методы.

Важность: 3/5

Заметная статья HuggingFace Daily Paper (исследование) — самая популярная статья на HuggingFace Daily Papers за 2026-08-09 с 87 голосами; заявлен показатель успеха 89.1% на ALFWorld с Qwen2.5-7B, превосходящий существующие базовые методы.

Источники