Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Безучительная on-policy дистилляция для flow matching. На каждом шаге детерминированное предсказание следующего состояния студентом ветвится на K стохастических кандидатов SDE, разворачивается ODE-сэмплером и оценивается относительно детерминированной самореференции для получения нормализованных преимуществ. Затем поле скоростей оптимизируется с помощью all-branch pull-push цели. Превосходит прежние RL и OPD базлайны на бенчмарках с одной и смешанной наградой без необходимости в учителях под конкретные задачи.
Почему это важно
66 голосов в HF Daily Papers. Убирает главный ценовой блокер (обучение учителей под каждую задачу) для on-policy дистилляции в flow-matching генераторах.
Важность: 2/5
официальное подтверждение
Источники
официальный
HF Daily Papers entry for Self-OPD (66 upvotes)
официальный
arXiv listing