AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением

исследования официальный 1 ист. ~1 мин

Исследователи из Университета Цинхуа, Чжэцзянского университета и Meituan предлагают AgentOPSD — метод, перераспределяющий разреженные итоговые награды в пошаговые сигналы вклада для многошагового многораундового агентного RL с длинным горизонтом, используя рекурсивные байесовские обновления по разрывам правдоподобия между учителем и учеником вместо равномерного распределения преимущества на уровне траектории (как в GRPO). Метод достигает 89,1% успеха на ALFWorld с Qwen2.5-7B без дополнительных роллаутов или обученных критиков.

Почему это важно

Решает ключевую слабость текущего агентного RL (равномерное распределение вклада в стиле GRPO) без дополнительных затрат на роллауты; заняла #1 в Hugging Face Daily Papers за этот период с 73 голосами.

Важность: 2/5

Статья дня в топе Hugging Face Daily Papers, ниже порога в 100 голосов для повышения приоритета.

Источники