OPRD: вызов weak-to-strong генерализации через on-policy обратную дистилляцию

KAIST AI

исследования официальный 2 ист. ~1 мин

On-Policy Reverse Distillation позволяет более сильному ученику превзойти слабого учителя: метод оценивает сдвиг политики учителя на rollout'ах ученика и усиливает только поддерживаемый верификатором компонент градиента политики ученика вдоль этого направления, сохраняя стационарные точки и ускоряя обучение за пределами возможностей учителя. Среди авторов — Aaron Courville.

Важность: 2/5

Результат по weak-to-strong генерализации, значимый для alignment

Источники

официальный arXiv 2609.08798