DAPD: Dual-Anchored Policy Distillation
Работа выявляет режим отказа «иллюзии привилегии» в on-policy self-distillation, когда student-модель учится полагаться на привилегированную информацию учителя, доступную только во время обучения, но не в инференсе. DAPD устраняет это с помощью dual-path anchoring и dual-source anchoring, превосходя предыдущий on-policy self-distillation в среднем на +2.00 балла по шести бенчмаркам на Qwen3-4B.
Почему это важно
Запись в HuggingFace Daily Papers с 73 голосами; называет конкретный, ранее слабо описанный режим отказа в пайплайнах self-distillation, всё чаще используемых для сжатия reasoning-моделей.
Важность: 3/5
Заметная статья (73 голоса HF Daily Papers, ниже порога бонуса +1).
Источники
официальный
HuggingFace Daily Papers