#post-training
- Z.ai ships GLM-5.3: frontier coding via post-training only, emergent cyber capabilities Z.ai (Zhipu AI) models-llm
- Z.ai ships GLM-5.3 with frontier coding and emergent cyber capability zhipu models-llm
- Intern-S2-Preview: 397B scientific agentic foundation model from Shanghai AI Lab Shanghai AI Lab research
- Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs research
- On-Policy Self-Distillation in Diffusion Models ByteDance Seed research
- Feyospace-v1: a seven-person team trains open-weight frontier cyber agents feyospace research
- DRPO: Rethinking Divergence Regularization in LLM Reinforcement Learning Tencent Hunyuan research
- Terminal-Universe: turning agent trajectories into scalable terminal environments research
- NeoHorse-1: recursive self-improvement via agentic post-training TokenRhythm research
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD SLAI research
- Miles v0.1: a production-level RL post-training system RadixArk research
- Anatomy of Post-Training: Using Interpretability to Audit and Fix Preference Data research
- OPRD: On-Policy Representation Distillation for Post-Training LLMs research
- Tencent Hunyuan Open-Sources UniRL: Unified RL Post-Training for LLMs and Diffusion Models Tencent / Hunyuan research
- Weak-to-Strong Generalization via Direct On-Policy Distillation ByteDance / Tsinghua University research
- RL Post-Training Actively Builds Compositional Reasoning Strategies, Not Just Amplifies Base Skills research
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.) research
- Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO research
- Rethinking On-Policy Distillation of LLMs II: near-full gains from a single training example research