Specific выпустила бенчмарк Real-SWE на задачах из приватных корпоративных кодовых баз
Specific
Specific (YC F25) запустила Real-SWE — coding-бенчмарк из задач, лицензированных у реальных частных компаний; оцениваются пары «модель + harness» вроде Claude Code и Codex CLI с pass@1, усреднённым по восьми прогонам. Fable 5.1 через Claude Code лидирует с 38,8%, впереди GPT-6 Astra через Codex CLI (33,8%) и Gemini 3.8 Flash (31,2%); «пропущенное требование» — самый частый режим отказа, а стоимость прогона не предсказывала точность.
Почему это важно
Первый бенчмарк, изначально выходящий за пределы тренировочного распределения, показывает, насколько SWE-bench-подобные оценки приукрашивают frontier-агентов.
Важность: 3/5
Первый out-of-distribution корпоративный coding-бенчмарк; сильный отклик сообщества
Источники
официальный
Real-SWE Benchmark — Specific Labs