Действительно ли on-policy дистилляция дистиллирует? Безучительская OPSA обгоняет её на AIME24
Purdue University
В статье показано, что при on-policy дистилляции token-level супервизия учителя зашумлена (шум растёт с масштабом учителя), а студент её почти не использует: обучение идёт главным образом за счёт подавления токенов с низкой вероятностью, чему учитель не нужен. Авторы предлагают OPSA — метод без супервизии с entropy-адаптивными отрицательными преимуществами, который на Qwen3-1.7B даёт +35,41 Avg@32 на AIME24 (+263% относительно) и обгоняет on-policy дистилляцию на 16,77 пункта.
Почему это важно
31 апвоут на HF Daily Papers за 1 сентября; если сигнал учителя в основном не нужен, пайплайны дистилляции малых reasoning-моделей могут полностью отказаться от дорогого учителя.
Важность: 2/5
Высоко оценённая статья HF Daily Papers (31 апвоут), официальные источники