←

Код-репозиторий Шрёдингера: LLM выучили SWE-bench или зазубрили его?

Shanghai Jiao Tong University

исследования официальный 2 ист. ~1 мин

SchrodingerRepo от SJTU рассматривает тестовый репозиторий SWE-bench как переменную времени оценки, применяя четыре уровня трансформаций (реконструкция problem statement, переименование неймспейсов, переупорядочивание внутри файлов, сохраняющее функциональность переписывание) к SWE-bench Verified и SWE-QA. Удаление привычных сигналов нейминга/структуры стабильно снижает Pass@1 на 6,0–14,4 пункта, при этом 81,6–83,6% дополнительных усилий агента уходит на повторное исследование репозитория — доказательство, что часть текущих результатов на SWE-bench отражает зазубренные поверхностные сигналы, а не понимание репозитория.

Почему это важно

Прямой аудит на контаминацию самого цитируемого бенчмарка кодинг-агентов; находка меняет то, как следует читать цифры кодинг-агентов.

Важность: 3/5

Высокоэвристический аудит контаминации самого цитируемого бенчмарка для кодинг-агентов

Источники

официальный HuggingFace Daily Papers entry