GST-Bench проверяет, развивают ли VLM глобальное пространственное восприятие по видео

ByteDance Seed

исследования официальный 1 ист. ~1 мин

ByteDance Seed и академические партнёры представляют GST-Bench — бенчмарк видео-VQA из 2762 вопросов, проверяющий способность моделей «зрение-язык» выстраивать глобальное пространственное восприятие по длинным видео от первого лица, включая вывод с новых точек обзора и картирование в план сверху. Лучшая VLM в режиме zero-shot набирает 42,68 балла против базового уровня человека в 79,08; проприетарные модели ошибаются в основном на интеграции между кадрами, открытые модели ошибаются как в локальных, так и в глобальных рассуждениях.

Почему это важно

Количественно оценивает крупный и конкретный разрыв в пространственном мышлении VLM, который в основном упускают текущие бенчмарки; 36 голосов в Hugging Face Daily Papers.

Важность: 2/5

Заметный бенчмарк, количественно оценивающий конкретную слабость VLM, ниже порога в 100 голосов для повышения приоритета.

Источники