Weak-to-Strong On-Policy Distillation

Microsoft Research / University of Maryland / MBZUAI

исследования официальный 2 ист. ~1 мин

Представляет W2S-OPD — метод, строящий прокси-учителя из разницы логитов пары более слабых моделей (позитивной и негативной), чтобы дистиллировать способности в студенческую модель даже при отсутствии более сильного учителя. Студент минимизирует поточечную обратную KL-дивергенцию относительно этого прокси-учителя на собственных rollout'ах.

Почему это важно

Решает практическое ограничение on-policy дистилляции на передовом уровне, где более крупная модель-учитель недоступна для дистилляции; получила 18 голосов на HuggingFace Daily Papers (2026-08-03).

Важность: 2/5

Заметный исследовательский вклад в on-policy дистилляцию, но ниже порога в 100 голосов для бонуса HF Daily.

Источники

официальный Weak-to-Strong On-Policy Distillation
официальный W2S-OPD code repository