#rlvr
- VibeThinker-3B достигает показателей frontier-уровня на бенчмарках рассуждений через curriculum RL WeiboAI research
- Annotations as Rollouts: эффективный и масштабируемый reinforcement learning для видео-MLLM research
- TLive-Omni: omnimodal-модель понимания для e-commerce-стриминга Tencent research
- DataFlex-RL: оценочная платформа показала, что политики отбора данных для RLVR не превосходят равномерный сэмплинг Peking University research
- DRPO: переосмысление дивергентной регуляризации в обучении с подкреплением для LLM Tencent Hunyuan research
- Ring-Zero: масштабирование Zero RL до триллиона параметров с возникающими паттернами рассуждения Ant Group research
- TRL v1.11.0 переписывает trl vllm-serve (~в10 раз меньше кода) и выпускает AsyncDistillationTrainer Hugging Face tools