ASI-Bench: на заре искусственного суперинтеллекта
42-author consortium (lead: Junwei Zhou; incl. Chi Wang, Yilun Hao, Yuantao Zhai)
60 проектных исследовательских задач в 11 научных областях, построенных на 31 000+ человеко-часах с прогрессивно уменьшающимся человеческим руководством. На 18 конфигурациях агент-моделей средние оценки падают с 50.91 (полное руководство) до 29.10 (задан метод) до 26.62 (метод определяется агентом).
Почему это важно
55 HF upvotes (19 августа) — первый бенчмарк, совместно измеряющий инновационную эксплорацию и автономное научное исполнение, с намеренно публичным submission-порталом, чтобы сюита могла расти вместе с полем.
Важность: 2/5
default
Источники
официальный
arXiv — ASI-Bench paper
официальный
HuggingFace Daily Papers — ASI-Bench