Mage-VL: эффективная кодек-нативная потоковая мультимодальная базовая модель

Microsoft

исследования офиц. + СМИ 2 ист. ~1 мин

Мультимодальная модель на 4 млрд параметров с собственным визуальным токенизатором (Mage-ViT), который избирательно кодирует области видеопотока, богатые движением и остаточной информацией, вместо равномерной выборки кадров, сокращая число визуальных токенов более чем на 75% и обеспечивая до 3.5 раза более быстрый инференс.

Почему это важно

При 4 млрд параметров сравнима с Qwen3-VL-4B на общих VQA-задачах и превосходит значительно более крупную Phi-4-R-V-15B в пространственном и видеопонимании, решая проблему восприятия в реальном времени — известное слабое место VLM-моделей.

Важность: 3/5

Заметная исследовательская статья от Microsoft, посвящённая эффективности мультимодальных моделей, ниже эвристического порога в 100 голосов.

Источники

официальный Mage-VL