ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

Shanghai Jiao Tong University

Research official 2 src. ~1 min

Introduces Answer-Backtracked Credit Assignment (ABC), which traces back from a final answer to recover the intermediate clues needed to solve a question, converting sparse trajectory-level outcome rewards into dense, step-level supervision for training long-horizon search agents.

Why it matters

The resulting ABSeeker agent, built on Qwen3.5-4B with only 8.5k training examples, rewards useful steps even inside failed trajectories, offering a more sample-efficient way to train agents on long multi-step search tasks.

Importance: 2/5

Notable sample-efficiency result for training long-horizon search agents.

Sources