SWE-bench Science: могут ли кодинг-агенты решать инженерные задачи в науке?
OpenMOSS
Репозиторный бенчмарк из 119 задач в 98 GitHub-репозиториях по 20 научным доменам, охватывающий парадигмы issue-driven, expert-exploratory и engineering-integration. Лучший агент (Claude Code на Opus) набирает менее 50% pass@1; в работе каталогизированы четыре повторяющихся механизма отказа.
Почему это важно
HuggingFace Daily Papers: 52 upvotes. Расширяет линейку SWE-bench за пределы разработки ПО в научные вычисления — полезный сигнал о том, что топовые кодинг-агенты остаются хрупкими вне мейнстримных стеков.
Важность: 2/5
HF Daily Paper с 52 upvotes
Источники
официальный
arXiv abstract page
официальный
HF Daily Papers entry