OPRD: вызов weak-to-strong генерализации через on-policy обратную дистилляцию
KAIST AI
On-Policy Reverse Distillation позволяет более сильному ученику превзойти слабого учителя: метод оценивает сдвиг политики учителя на rollout'ах ученика и усиливает только поддерживаемый верификатором компонент градиента политики ученика вдоль этого направления, сохраняя стационарные точки и ускоряя обучение за пределами возможностей учителя. Среди авторов — Aaron Courville.
Важность: 2/5
Результат по weak-to-strong генерализации, значимый для alignment
Источники
официальный
arXiv 2609.08798