AREX: на пути к рекурсивно самосовершенствующемуся агенту для глубокого исследования

исследования офиц. + СМИ 2 ист. ~1 мин

AREX — семейство агентов для глубокого исследования (плотная модель на 4B и MoE-модель 122B-A10B), обученных с помощью reinforcement learning на верифицированных синтетических задачах. Работает по схеме с двумя циклами: внутренний цикл собирает свидетельства и составляет предварительные ответы, внешний цикл проверяет ответ по каждому ограничению и запускает целевые дополнительные поиски по неразрешённым утверждениям. Обучаемый инструмент обновления контекста автономно сжимает растущую историю взаимодействия в компактное состояние, сохраняющее верифицированные свидетельства.

Почему это важно

141 голос на HuggingFace Daily Papers; самопроверяющий внешний цикл и автономное сжатие контекста устраняют два устойчивых недостатка агентов для долгосрочного исследования, показывая конкурентоспособные результаты по сравнению с более крупными моделями на BrowseComp, WideSearch, DeepSearchQA и Humanity's Last Exam.

Важность: 3/5

141 голос на HF Daily (выше порога в 100 голосов для бампа) плюс сильные результаты на бенчмарках агентов для глубокого исследования.

Источники