AREX: на пути к рекурсивно самосовершенствующемуся агенту для глубокого исследования
AREX — семейство агентов для глубокого исследования (плотная модель на 4B и MoE-модель 122B-A10B), обученных с помощью reinforcement learning на верифицированных синтетических задачах. Работает по схеме с двумя циклами: внутренний цикл собирает свидетельства и составляет предварительные ответы, внешний цикл проверяет ответ по каждому ограничению и запускает целевые дополнительные поиски по неразрешённым утверждениям. Обучаемый инструмент обновления контекста автономно сжимает растущую историю взаимодействия в компактное состояние, сохраняющее верифицированные свидетельства.
Почему это важно
141 голос на HuggingFace Daily Papers; самопроверяющий внешний цикл и автономное сжатие контекста устраняют два устойчивых недостатка агентов для долгосрочного исследования, показывая конкурентоспособные результаты по сравнению с более крупными моделями на BrowseComp, WideSearch, DeepSearchQA и Humanity's Last Exam.
Важность: 3/5
141 голос на HF Daily (выше порога в 100 голосов для бампа) плюс сильные результаты на бенчмарках агентов для глубокого исследования.