Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

исследования официальный 2 ист. ~1 мин

Безучительная on-policy дистилляция для flow matching. На каждом шаге детерминированное предсказание следующего состояния студентом ветвится на K стохастических кандидатов SDE, разворачивается ODE-сэмплером и оценивается относительно детерминированной самореференции для получения нормализованных преимуществ. Затем поле скоростей оптимизируется с помощью all-branch pull-push цели. Превосходит прежние RL и OPD базлайны на бенчмарках с одной и смешанной наградой без необходимости в учителях под конкретные задачи.

Почему это важно

66 голосов в HF Daily Papers. Убирает главный ценовой блокер (обучение учителей под каждую задачу) для on-policy дистилляции в flow-matching генераторах.

Важность: 2/5

официальное подтверждение

Источники

официальный arXiv listing