#rlvr
- VibeThinker-3B Reaches Frontier-Level Reasoning Benchmarks via Curriculum RL WeiboAI research
- DRPO: Rethinking Divergence Regularization in LLM Reinforcement Learning Tencent Hunyuan research
- Ring-Zero: Scaling Zero RL to 1 Trillion Parameters with Emergent Reasoning Behaviors Ant Group research