Benchmark Radar: живая база данных и поисковая система по ИИ-бенчмаркам

Carnegie Mellon University

исследования офиц. + СМИ 2 ист. ~1 мин

Постоянно обновляемый каталог и поисковая система по ИИ-бенчмаркам — LLM, агентным, кодинговым, reasoning- и safety-оценкам, — агрегирующая ежедневно из 37 источников: 1283 записи и 12916 наблюдений оценок с сохранёнными цепочками цитирования. Также содержит анализы насыщения бенчмарков, тренды adoption и workflow поиска прецедентов для проектирования новых оценок.

Почему это важно

Закрывает хроническую неспособность поля находить, версионировать и сравнивать бенчмарки; представления насыщения и трендов делают фрагментацию оценок видимой в одном месте.

Важность: 2/5

Заметная статья об оценочной инфраструктуре, 80 апвоутов на HF Daily

Источники