LoopArena: бенчмаркинг моделей как рантайм-контроллеров для loop engineering
Бенчмарк для оценки модели-контроллера, которая ведёт отдельного фиксированного кодинг-агента-воркера через длительные задачи: после каждого раунда кодинга она читает структурированную сводку прогона и решает, что делать дальше, верифицировать или остановиться. Разделяет способность к управлению циклом от сырых кодинг-способностей воркера в трёх настройках охвата исполнения.
Почему это важно
Топ HF Daily Paper за 31 августа со 99 апвоутами; первый бенчмарк паттерна «loop engineering» вокруг кодинг-агентов
Важность: 2/5
Топ HF Daily Paper (99 апвоутов)
Источники
официальный
LoopArena - Hugging Face Daily Papers