AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением
Исследователи из Университета Цинхуа, Чжэцзянского университета и Meituan предлагают AgentOPSD — метод, перераспределяющий разреженные итоговые награды в пошаговые сигналы вклада для многошагового многораундового агентного RL с длинным горизонтом, используя рекурсивные байесовские обновления по разрывам правдоподобия между учителем и учеником вместо равномерного распределения преимущества на уровне траектории (как в GRPO). Метод достигает 89,1% успеха на ALFWorld с Qwen2.5-7B без дополнительных роллаутов или обученных критиков.
Почему это важно
Решает ключевую слабость текущего агентного RL (равномерное распределение вклада в стиле GRPO) без дополнительных затрат на роллауты; заняла #1 в Hugging Face Daily Papers за этот период с 73 голосами.
Важность: 2/5
Статья дня в топе Hugging Face Daily Papers, ниже порога в 100 голосов для повышения приоритета.