Эмпирическое исследование дизайна харнессов для кодинг-агентов
Zoom
Исследование фиксирует цикл исполнения и варьирует три компонента харнесса — планирование, пространство действий и управление контекстом — на четырёх моделях и 176 согласованных настройках на SWE-Bench Verified и Terminal-Bench 2.1. Выводы: управление контекстом важнее всего при жёстких бюджетах (rule-based elision бьёт LLM-суммаризацию), планирование в основном снижает стоимость у сильных моделей, а модели с bash-способностями хорошо работают с bash-only интерфейсом инструментов при куда меньшей цене.
Почему это важно
Одна из первых контролируемых эмпирических карт того, как выбор скаффолдинга — а не только модель — определяет производительность и стоимость кодинг-агента.
Важность: 2/5
Заметное эмпирическое исследование для создателей кодинг-агентов