Действительно ли on-policy дистилляция дистиллирует? Безучительская OPSA обгоняет её на AIME24

Purdue University

исследования официальный 2 ист. ~1 мин

В статье показано, что при on-policy дистилляции token-level супервизия учителя зашумлена (шум растёт с масштабом учителя), а студент её почти не использует: обучение идёт главным образом за счёт подавления токенов с низкой вероятностью, чему учитель не нужен. Авторы предлагают OPSA — метод без супервизии с entropy-адаптивными отрицательными преимуществами, который на Qwen3-1.7B даёт +35,41 Avg@32 на AIME24 (+263% относительно) и обгоняет on-policy дистилляцию на 16,77 пункта.

Почему это важно

31 апвоут на HF Daily Papers за 1 сентября; если сигнал учителя в основном не нужен, пайплайны дистилляции малых reasoning-моделей могут полностью отказаться от дорогого учителя.

Важность: 2/5

Высоко оценённая статья HF Daily Papers (31 апвоут), официальные источники

Источники