DAPD: Dual-Anchored Policy Distillation

исследования официальный 1 ист. ~1 мин

Работа выявляет режим отказа «иллюзии привилегии» в on-policy self-distillation, когда student-модель учится полагаться на привилегированную информацию учителя, доступную только во время обучения, но не в инференсе. DAPD устраняет это с помощью dual-path anchoring и dual-source anchoring, превосходя предыдущий on-policy self-distillation в среднем на +2.00 балла по шести бенчмаркам на Qwen3-4B.

Почему это важно

Запись в HuggingFace Daily Papers с 73 голосами; называет конкретный, ранее слабо описанный режим отказа в пайплайнах self-distillation, всё чаще используемых для сжатия reasoning-моделей.

Важность: 3/5

Заметная статья (73 голоса HF Daily Papers, ниже порога бонуса +1).

Источники

официальный HuggingFace Daily Papers