Sci-VBench: оценка генерации видео, насыщенного знаниями и рассуждениями, в научных областях
Представляет бенчмарк из 1253 примеров с экспертной разметкой по 60 темам в четырёх научных дисциплинах для проверки того, правильно ли модели генерации видео передают научные факты и причинно-следственную динамику, а не только визуальный реализм. Обнаруживает, что модели сильно различаются по научной корректности, с выраженным разрывом между проприетарными и открытыми системами.
Почему это важно
21 голос в HuggingFace Daily Papers; закрывает пробел в оценке генерации видео, который упускают текущие бенчмарки (оценивающие только визуальное качество).
Важность: 2/5
Заметная статья (21 голос в HF Daily Papers, ниже порога в 100 голосов для повышения важности).
Источники
официальный
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
вторичный
HuggingFace Daily Papers, 2026-08-11