#rlvr
- VibeThinker-3B достигает показателей frontier-уровня на бенчмарках рассуждений через curriculum RL WeiboAI research
- DRPO: переосмысление дивергентной регуляризации в обучении с подкреплением для LLM Tencent Hunyuan research
- Ring-Zero: масштабирование Zero RL до триллиона параметров с возникающими паттернами рассуждения Ant Group research