TTPO: Test-Time Policy Optimization
Безлейбловый метод пост-обучения, использующий асимметричный режим сбоев в псевдо-метках majority-vote: rollout'ы, не согласные с псевдо-меткой, обычно неверны вне зависимости от голосования. Согласные rollout'ы дистиллируются через On-Policy Self-Distillation, несогласные штрафуются через Grouped RL. Без ground-truth меток TTPO матчит label-supervised OPSD на пяти соревновательных бенчмарках и поднимает Qwen3-1.7B с 38,0% до 45,2%.
Почему это важно
67 голосов в HF Daily Papers. Демонстрирует безлейбловый пайплайн пост-обучения в стиле RLVR, конкурирующий с методами, требующими меток.
Важность: 2/5
официальное подтверждение
Источники
официальный
HF Daily Papers entry for TTPO (67 upvotes)
официальный
arXiv listing