RealSWE: бенчмарк кодинг-агентов, перестроенный вокруг реальных, небрежных пользовательских запросов
Авторы количественно оценивают разрыв между задачами в стиле SWE-bench и реальным использованием: 88% реальных промптов содержат только голую постановку проблемы (против 7% бенчмарк-задач), и 87% написаны небрежно против 94% формальных в бенчмарках. RealSWE выводит 381 семейство многовариантных задач из SWE-bench Verified и Pro, чтобы тестировать композиционное поведение при реалистичных стилях запросов.
Почему это важно
Утверждает, что текущие результаты кодинг-агентов преувеличивают готовность к реальной работе, потому что измеряются на курируемых, информационно насыщенных issue, а не на том, как пользователи пишут на самом деле.
Важность: 2/5
Заметная статья по оценке, ниже планки в 100 апвотов