ASI-Bench: на заре искусственного суперинтеллекта

42-author consortium (lead: Junwei Zhou; incl. Chi Wang, Yilun Hao, Yuantao Zhai)

исследования официальный 2 ист. ~1 мин

60 проектных исследовательских задач в 11 научных областях, построенных на 31 000+ человеко-часах с прогрессивно уменьшающимся человеческим руководством. На 18 конфигурациях агент-моделей средние оценки падают с 50.91 (полное руководство) до 29.10 (задан метод) до 26.62 (метод определяется агентом).

Почему это важно

55 HF upvotes (19 августа) — первый бенчмарк, совместно измеряющий инновационную эксплорацию и автономное научное исполнение, с намеренно публичным submission-порталом, чтобы сюита могла расти вместе с полем.

Важность: 2/5

default

Источники

официальный arXiv — ASI-Bench paper