RealSWE: бенчмарк кодинг-агентов, перестроенный вокруг реальных, небрежных пользовательских запросов

исследования официальный 2 ист. ~1 мин

Авторы количественно оценивают разрыв между задачами в стиле SWE-bench и реальным использованием: 88% реальных промптов содержат только голую постановку проблемы (против 7% бенчмарк-задач), и 87% написаны небрежно против 94% формальных в бенчмарках. RealSWE выводит 381 семейство многовариантных задач из SWE-bench Verified и Pro, чтобы тестировать композиционное поведение при реалистичных стилях запросов.

Почему это важно

Утверждает, что текущие результаты кодинг-агентов преувеличивают готовность к реальной работе, потому что измеряются на курируемых, информационно насыщенных issue, а не на том, как пользователи пишут на самом деле.

Важность: 2/5

Заметная статья по оценке, ниже планки в 100 апвотов

Источники

вторичный RealSWE — Hugging Face Daily Papers (syndicated from arXiv)