-
VibeThinker-3B Reaches Frontier-Level Reasoning Benchmarks via Curriculum RL
WeiboAI
research
-
OpenAI unveils GPT-Red, an internal automated red-teaming model for prompt-injection defense
OpenAI
research
-
Exploration Hacking: LLMs Can Be Fine-Tuned to Strategically Resist RL Training
research
-
OpenAI Discloses Accidental Chain-of-Thought Grading in RL Training Across Six Models
OpenAI
research
-
Google DeepMind's AI Co-Mathematician Reaches 48% on FrontierMath Tier 4
Google DeepMind
research
-
Flow-OPD: On-Policy Distillation Pushes GenEval +29 Points on Stable Diffusion 3.5
research
-
RubricEM: Meta-RL with Rubric-Guided Policy Decomposition Beyond Verifiable Rewards
Google
research
-
SU-01: Gold-Medal-Level Olympiad Reasoning via Curriculum SFT and Two-Stage RL
SU-01 Team
research
-
SkillsVote: Lifecycle Governance of Agent Skills — Collection, Recommendation, Evolution (219 HF upvotes)
Memtensor Research Group / IAAR-Shanghai
research
-
Qwen-AgentWorld: Language World Models for General Agents at 35B and 397B Scale
Qwen Team, Alibaba
research
-
Dockerless: Environment-Free Program Verifier for Coding Agents
ByteDance
research
-
DOPD: Dual On-Policy Distillation with Advantage-Aware Token Routing
research
-
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
Tianjin University / Alibaba
research
-
Long-Horizon-Terminal-Bench: Testing Agent Limits on Long-Horizon Terminal Tasks
Tencent Hunyuan
research
-
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
NVIDIA
research
-
Anthropic Eliminates Claude's Agentic Blackmail Behavior via 'Teaching Claude Why'
Anthropic
research
-
DRPO: Rethinking Divergence Regularization in LLM Reinforcement Learning
Tencent Hunyuan
research
-
LLM-as-a-Verifier: verification as an independent scaling axis for LLMs
Stanford University / UC Berkeley / NVIDIA
research
-
Kimi K3 Technical Report: Kimi Delta Attention and Stable LatentMoE Architecture Detailed
Moonshot AI
research
-
Learning while Deploying: Fleet-Scale Reinforcement Learning Turns Robot Deployment into Continuous Training
AGIBot
research
-
Ctx2Skill: Self-Improving Framework for Autonomous Context-Skill Discovery in LLMs
research
-
RLDX-1: Multi-Stream Action Transformer Achieves 86.8% on ALLEX Humanoid Tasks
RLWRLD
research
-
OpenSearch-VL: Open Recipe for Training Frontier Multimodal Search Agents
Tencent Hunyuan
research
-
SDAR: Self-Distilled Agentic Reinforcement Learning for Multi-Turn Agents
Zhejiang University / Meituan
research
-
GrepSeek: Training Search Agents for Direct Corpus Interaction via Shell Commands (93 HF Upvotes)
University of Massachusetts Amherst
research
-
ThoughtFold: Introspective Preference Learning Cuts Reasoning Tokens by 56% Without Accuracy Loss
research
-
Agentic Transformers Provably Learn Depth-First Search via Reinforcement Learning
Carnegie Mellon University / Ohio State University
research
-
Flow-DPPO: Principled RL Alignment for Flow Matching Image and Video Models
Tencent Hunyuan
research
-
Arbor: Generalist Autonomous ML Research via Hypothesis-Tree Refinement
NLPIR Lab
research
-
Z-Reward: Score Distributions Instead of Scalar Rewards for Image Generation RLHF
Alibaba
research
-
InterleaveThinker: RL Planner+Critic Pipeline for Interleaved Text-and-Image Generation
CUHK Multimedia Lab
research
-
OPID: On-Policy Skill Distillation Improves Long-Horizon Agent RL
Institute of Automation, Chinese Academy of Sciences
research
-
CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
Zhipu AI / Tsinghua University
research
-
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
Ant Group / Renmin University
research
-
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
research
-
From Pixels to States: Rethinking Interactive World Models as Game Engines
research
-
Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
research
-
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Horizon Research, Frontis.AI, Tsinghua University
research
-
CoPD: co-evolving policy distillation for unified multi-capability models
research
-
Odysseus: Training VLMs for 100+ Turn Interactive Decision-Making via RL
Princeton University
research
-
TrOPD: Trust-Region On-Policy Distillation Stabilizes LLM Training When Teacher-Student Gap Is Large
Samsung Research
research
-
InterleaveThinker: RL Framework for Agentic Text-and-Image Interleaved Generation
research
-
FORT-Searcher: Shortcut-Resistant Training Data Framework for Deep Search Agents
research
-
Astra: RL-Trained VLM Queries World Simulator for Spatial Reasoning
research
-
The Verification Horizon: No Single Reward Function Works for Coding Agents at Scale
Qwen (Alibaba)
research
-
EvoPolicyGym: Evaluating Iterative RL Policy Self-Improvement by Coding Agents
University of Macau / CUHK
research
-
Pass the Baton: Trajectory-Relayed On-Policy Distillation
Zhejiang University
research
-
HeavySkill: Internalizing Heavy Thinking as a Trainable Agentic Skill via RL
research
-
NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized AI Research Automation
Shanghai AI Lab
research
-
TMAS: Scaling Test-Time Compute via Multi-Agent Synergy with Hierarchical Memory
research
-
BetaPRM: Uncertainty-Aware Process Rewards Cut Reasoning Token Use by 33%
research
-
NudgeRL: Strategy-Level Context Nudges for Efficient RLVR Exploration
KAIST AI
research
-
QUBRIC: Co-Designing Queries and Rubrics Extends RLVR to Open-Ended Reasoning Domains
research
-
On the Geometry of On-Policy Distillation: A Training Paradigm Distinct from SFT and RLVR
Hong Kong University of Science and Technology
research
-
Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
Rutgers University
research
-
ZPPO: Teacher-in-Prompts Knowledge Distillation Outperforms Gradient Methods for Small Reasoners
NVIDIA
research
-
Agentic Transformers Provably Learn to Search via Reinforcement Learning
research
-
OPRD: On-Policy Representation Distillation for Post-Training LLMs
research
-
VRRL: Visually Grounded Self-Reflection for Vision-Language Models via RL
UT Austin / Cornell
research
-
Weak-to-Strong Generalization via Direct On-Policy Distillation
ByteDance / Tsinghua University
research
-
RL Post-Training Actively Builds Compositional Reasoning Strategies, Not Just Amplifies Base Skills
research
-
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
Mind Lab
research
-
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
inclusionAI
research
-
Understanding Reasoning from Pretraining to Post-Training
research
-
AREX: Towards a Recursively Self-Improving Agent for Deep Research
Beijing Academy of Artificial Intelligence (BAAI)
research
-
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
Alibaba
research
-
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
research
-
Weak-to-Strong On-Policy Distillation
Microsoft Research / University of Maryland / MBZUAI
research
-
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
HKUST/NUS/Oxford/NTU
research
-
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
Microsoft Research
research