OSReward тестирует кросс-платформенные модели вознаграждения для computer-use

University of Hong Kong

исследования официальный 1 ист. ~1 мин

Команда из нескольких университетов создала OSReward — бенчмарк из 1019 размеченных людьми траекторий computer-use на вебе, Windows, Ubuntu и мобильных устройствах — для проверки надёжности VLM в роли судьи. Топовые модели-судьи набирают около 90% в целом, но падают до 70% на сложных случаях, в основном ошибочно засчитывая незавершённые задачи как успешные; команда также выпустила открытые модели-судьи OS-Shepherd (9B/35B), сопоставимые с коммерческими судьями при цене в 30-60 раз ниже.

Почему это важно

Выявляет системную слепую зону (ложноположительное засчитывание завершения задач) при использовании LLM для оценки computer-use агентов и предлагает открытую, дешёвую альтернативу; 60 голосов в Hugging Face Daily Papers.

Важность: 2/5

Заметный бенчмарк и релиз открытой модели-судьи, ниже порога в 100 голосов для повышения приоритета.

Источники