#post-training
- DRPO: Rethinking Divergence Regularization in LLM Reinforcement Learning Tencent Hunyuan research
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD SLAI research
- Anatomy of Post-Training: Using Interpretability to Audit and Fix Preference Data research
- OPRD: On-Policy Representation Distillation for Post-Training LLMs research
- Tencent Hunyuan Open-Sources UniRL: Unified RL Post-Training for LLMs and Diffusion Models Tencent / Hunyuan research
- Weak-to-Strong Generalization via Direct On-Policy Distillation ByteDance / Tsinghua University research
- RL Post-Training Actively Builds Compositional Reasoning Strategies, Not Just Amplifies Base Skills research