LongHorizon-Harness: развитие агентов для долгих горизонтов в реальных задачах

исследования официальный 2 ист. ~1 мин

Harness, переформулирующий выполнение агентом долгих горизонтов задач как явную проблему управления состоянием задачи: верифицированное состояние хранится вне растущего контекста модели вместо неконтролируемого накопления допущений. Он поднимает Qwen 3.7-Plus с 51.8% до 80.7% на WeaveBench и с 2.8% до 8.3% на OSWorld 2.0, а также поднимает Claude Opus 4.7 с 20.0% до 34.3% на подмножестве OSWorld 2.0.

Почему это важно

Топ-выбор HuggingFace Daily Papers за 4 августа 2026 года с 210 голосами; крупные скачки на бенчмарках компьютерного использования с долгим горизонтом говорят о том, что управление состоянием, а не просто масштаб модели, — важный рычаг надёжности агентов.

Важность: 4/5

Заметная статья с 210 голосами HF Daily Papers (порог >=100), бонус +1.

Источники

официальный HuggingFace Daily Papers