TTPO: Test-Time Policy Optimization

исследования официальный 2 ист. ~1 мин

Безлейбловый метод пост-обучения, использующий асимметричный режим сбоев в псевдо-метках majority-vote: rollout'ы, не согласные с псевдо-меткой, обычно неверны вне зависимости от голосования. Согласные rollout'ы дистиллируются через On-Policy Self-Distillation, несогласные штрафуются через Grouped RL. Без ground-truth меток TTPO матчит label-supervised OPSD на пяти соревновательных бенчмарках и поднимает Qwen3-1.7B с 38,0% до 45,2%.

Почему это важно

67 голосов в HF Daily Papers. Демонстрирует безлейбловый пайплайн пост-обучения в стиле RLVR, конкурирующий с методами, требующими меток.

Важность: 2/5

официальное подтверждение

Источники

официальный arXiv listing