Weak-to-Strong On-Policy Distillation
Microsoft Research / University of Maryland / MBZUAI
Представляет W2S-OPD — метод, строящий прокси-учителя из разницы логитов пары более слабых моделей (позитивной и негативной), чтобы дистиллировать способности в студенческую модель даже при отсутствии более сильного учителя. Студент минимизирует поточечную обратную KL-дивергенцию относительно этого прокси-учителя на собственных rollout'ах.
Почему это важно
Решает практическое ограничение on-policy дистилляции на передовом уровне, где более крупная модель-учитель недоступна для дистилляции; получила 18 голосов на HuggingFace Daily Papers (2026-08-03).
Важность: 2/5
Заметный исследовательский вклад в on-policy дистилляцию, но ниже порога в 100 голосов для бонуса HF Daily.
Источники
официальный
Weak-to-Strong On-Policy Distillation
официальный
W2S-OPD code repository