ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
Shanghai Jiao Tong University
Introduces Answer-Backtracked Credit Assignment (ABC), which traces back from a final answer to recover the intermediate clues needed to solve a question, converting sparse trajectory-level outcome rewards into dense, step-level supervision for training long-horizon search agents.
Why it matters
The resulting ABSeeker agent, built on Qwen3.5-4B with only 8.5k training examples, rewards useful steps even inside failed trajectories, offering a more sample-efficient way to train agents on long multi-step search tasks.
Importance: 2/5
Notable sample-efficiency result for training long-horizon search agents.
Sources
official
HuggingFace Daily Papers, 2026-08-06