GST-Bench проверяет, развивают ли VLM глобальное пространственное восприятие по видео
ByteDance Seed
ByteDance Seed и академические партнёры представляют GST-Bench — бенчмарк видео-VQA из 2762 вопросов, проверяющий способность моделей «зрение-язык» выстраивать глобальное пространственное восприятие по длинным видео от первого лица, включая вывод с новых точек обзора и картирование в план сверху. Лучшая VLM в режиме zero-shot набирает 42,68 балла против базового уровня человека в 79,08; проприетарные модели ошибаются в основном на интеграции между кадрами, открытые модели ошибаются как в локальных, так и в глобальных рассуждениях.
Почему это важно
Количественно оценивает крупный и конкретный разрыв в пространственном мышлении VLM, который в основном упускают текущие бенчмарки; 36 голосов в Hugging Face Daily Papers.
Важность: 2/5
Заметный бенчмарк, количественно оценивающий конкретную слабость VLM, ниже порога в 100 голосов для повышения приоритета.