Эмпирическое исследование дизайна харнессов для кодинг-агентов

Zoom

исследования официальный 2 ист. ~1 мин

Исследование фиксирует цикл исполнения и варьирует три компонента харнесса — планирование, пространство действий и управление контекстом — на четырёх моделях и 176 согласованных настройках на SWE-Bench Verified и Terminal-Bench 2.1. Выводы: управление контекстом важнее всего при жёстких бюджетах (rule-based elision бьёт LLM-суммаризацию), планирование в основном снижает стоимость у сильных моделей, а модели с bash-способностями хорошо работают с bash-only интерфейсом инструментов при куда меньшей цене.

Почему это важно

Одна из первых контролируемых эмпирических карт того, как выбор скаффолдинга — а не только модель — определяет производительность и стоимость кодинг-агента.

Важность: 2/5

Заметное эмпирическое исследование для создателей кодинг-агентов

Источники