On-policy само-дистилляция в диффузионных моделях

ByteDance Seed

исследования офиц. + СМИ 2 ист. ~1 мин

DiffusionOPSD превращает reward-гайданс уровня изображения в явные таргеты для предсказаний чистого вывода на выбранных квери, разделяя построение таргета и его конечную реализацию. Замороженная behavior-политика генерирует траектории и поставляет квери-состояния и якоря; reward-градиенты строят ограниченные положительные и отрицательные таргеты вокруг каждого якоря; обучаемая политика фитит их как detached-супервизию через конечную подгонку перед EMA-обновлением behavior-политики. Достигает лучших финальных held-out-баллов в 19 из 20 reward-согласованных настроек на SD 3.5-M и Z-Image-Turbo и десяти оценщиках, превосходя сильнейшего конкурента до 44%, с сокращением GPU-часов тренинга на 40%/63% против DiffusionNFT.

Почему это важно

HF Daily 31 апвоут 26 августа. Даёт измеренную декомпозицию того, откуда реально приходят приросты в диффузионном пост-тренинге — контролируемые same-query эксперименты показывают, что большие приросты на построении не всегда дают большие приросты на реализации.

Важность: 3/5

HF Daily 31 апвоут

Источники

официальный arXiv abstract