#training-dynamics
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning Tianjin University / Alibaba research
- Super Weights in LLMs: Why High-Salience Parameters Fail as Fine-Tuning Targets Amazon research
- On the Geometry of On-Policy Distillation: A Training Paradigm Distinct from SFT and RLVR Hong Kong University of Science and Technology research
- Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models research
- RL Post-Training Actively Builds Compositional Reasoning Strategies, Not Just Amplifies Base Skills research