ABSeeker: обучение поисковых агентов с длинным горизонтом через распределение наград методом обратного отслеживания ответа

Shanghai Jiao Tong University

исследования официальный 2 ист. ~1 мин

Представляет Answer-Backtracked Credit Assignment (ABC) — метод, который прослеживает путь от финального ответа назад, чтобы восстановить промежуточные подсказки, необходимые для решения вопроса, превращая разреженные награды на уровне всей траектории в плотное, пошаговое обучающее сигнальное подкрепление для обучения поисковых агентов с длинным горизонтом.

Почему это важно

Полученный агент ABSeeker, построенный на Qwen3.5-4B всего с 8,5 тыс. обучающих примеров, вознаграждает полезные шаги даже внутри неудачных траекторий, предлагая более эффективный по данным способ обучать агентов многошаговым поисковым задачам с длинным горизонтом.

Важность: 2/5

Заметный результат по эффективности использования данных при обучении поисковых агентов с длинным горизонтом.

Источники

официальный HuggingFace Daily Papers, 2026-08-06