DAPD выявляет режим отказа «иллюзия привилегии» в самодистилляции on-policy
Shanghai AI Laboratory
Выявляет режим отказа «иллюзия привилегии» (privilege illusion) в самодистилляции on-policy, при котором модель-ученик усваивает поведение, зависящее от привилегированной информации, доступной во время обучения, но недоступной при инференсе. Предлагает Dual-Path и Dual-Source Anchoring для двунаправленного согласования поведения референсной модели и роллаутов, улучшая результаты предыдущей on-policy самодистилляции примерно на 2-2,8 балла на моделях Qwen3 от 4B до 32B.
Почему это важно
Опубликовано с более чем 100 отметками «нравится» в HuggingFace Daily Papers; устраняет тонкий, но широко применимый режим отказа во всё более распространённом рецепте обучения с on-policy самодистилляцией.
Важность: 3/5
Применён бонус за HF Daily Papers с >=100 отметками «нравится».