OSReward тестирует кросс-платформенные модели вознаграждения для computer-use
University of Hong Kong
Команда из нескольких университетов создала OSReward — бенчмарк из 1019 размеченных людьми траекторий computer-use на вебе, Windows, Ubuntu и мобильных устройствах — для проверки надёжности VLM в роли судьи. Топовые модели-судьи набирают около 90% в целом, но падают до 70% на сложных случаях, в основном ошибочно засчитывая незавершённые задачи как успешные; команда также выпустила открытые модели-судьи OS-Shepherd (9B/35B), сопоставимые с коммерческими судьями при цене в 30-60 раз ниже.
Почему это важно
Выявляет системную слепую зону (ложноположительное засчитывание завершения задач) при использовании LLM для оценки computer-use агентов и предлагает открытую, дешёвую альтернативу; 60 голосов в Hugging Face Daily Papers.
Важность: 2/5
Заметный бенчмарк и релиз открытой модели-судьи, ниже порога в 100 голосов для повышения приоритета.