Benchmark Radar: живая база данных и поисковая система по ИИ-бенчмаркам
Carnegie Mellon University
Постоянно обновляемый каталог и поисковая система по ИИ-бенчмаркам — LLM, агентным, кодинговым, reasoning- и safety-оценкам, — агрегирующая ежедневно из 37 источников: 1283 записи и 12916 наблюдений оценок с сохранёнными цепочками цитирования. Также содержит анализы насыщения бенчмарков, тренды adoption и workflow поиска прецедентов для проектирования новых оценок.
Почему это важно
Закрывает хроническую неспособность поля находить, версионировать и сравнивать бенчмарки; представления насыщения и трендов делают фрагментацию оценок видимой в одном месте.
Важность: 2/5
Заметная статья об оценочной инфраструктуре, 80 апвоутов на HF Daily