DAPD выявляет режим отказа «иллюзия привилегии» в самодистилляции on-policy

Shanghai AI Laboratory

исследования официальный 1 ист. ~1 мин

Выявляет режим отказа «иллюзия привилегии» (privilege illusion) в самодистилляции on-policy, при котором модель-ученик усваивает поведение, зависящее от привилегированной информации, доступной во время обучения, но недоступной при инференсе. Предлагает Dual-Path и Dual-Source Anchoring для двунаправленного согласования поведения референсной модели и роллаутов, улучшая результаты предыдущей on-policy самодистилляции примерно на 2-2,8 балла на моделях Qwen3 от 4B до 32B.

Почему это важно

Опубликовано с более чем 100 отметками «нравится» в HuggingFace Daily Papers; устраняет тонкий, но широко применимый режим отказа во всё более распространённом рецепте обучения с on-policy самодистилляцией.

Важность: 3/5

Применён бонус за HF Daily Papers с >=100 отметками «нравится».

Источники