AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением
Tsinghua University
Представляет RL-метод без критика для многошаговых агентных задач, который агрегирует разницу вероятностей учителя и ученика в пошаговые индикаторы и поддерживает байесовское состояние убеждений для распределения заслуги между отдельными решающими шагами, превращая разреженные награды за результат в детализированный сигнал.
Почему это важно
Самая популярная статья на HuggingFace Daily Papers за 2026-08-09 с 87 голосами; заявлен показатель успеха 89.1% на ALFWorld с Qwen2.5-7B, превосходящий существующие базовые методы.
Важность: 3/5
Заметная статья HuggingFace Daily Paper (исследование) — самая популярная статья на HuggingFace Daily Papers за 2026-08-09 с 87 голосами; заявлен показатель успеха 89.1% на ALFWorld с Qwen2.5-7B, превосходящий существующие базовые методы.