LongHorizon-Harness: развитие агентов для долгих горизонтов в реальных задачах
Harness, переформулирующий выполнение агентом долгих горизонтов задач как явную проблему управления состоянием задачи: верифицированное состояние хранится вне растущего контекста модели вместо неконтролируемого накопления допущений. Он поднимает Qwen 3.7-Plus с 51.8% до 80.7% на WeaveBench и с 2.8% до 8.3% на OSWorld 2.0, а также поднимает Claude Opus 4.7 с 20.0% до 34.3% на подмножестве OSWorld 2.0.
Почему это важно
Топ-выбор HuggingFace Daily Papers за 4 августа 2026 года с 210 голосами; крупные скачки на бенчмарках компьютерного использования с долгим горизонтом говорят о том, что управление состоянием, а не просто масштаб модели, — важный рычаг надёжности агентов.
Важность: 4/5
Заметная статья с 210 голосами HF Daily Papers (порог >=100), бонус +1.
Источники
официальный
HuggingFace Daily Papers