GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео?
ByteDance Seed
Представляет бенчмарк для видео-вопросно-ответных задач, построенный на почти 6800 минутах синтетического видео, для проверки способности vision-language моделей интегрировать пространственные наблюдения по всему видео в целостное глобальное представление; протестировано 22 современные модели.
Почему это важно
Пятая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 42 голосами; лучшая модель в zero-shot режиме набирает лишь 42.68 против результата человека в 79.08 — существенный разрыв в способностях пространственного рассуждения по видео.
Важность: 2/5
Заметная статья HuggingFace Daily Paper (исследование) — пятая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 42 голосами; лучшая модель в zero-shot режиме набирает лишь 42.68 против результата человека в 79.08 — существенный разрыв в способностях пространственного рассуждения по видео.