Mage-VL: эффективная кодек-нативная потоковая мультимодальная базовая модель
Microsoft
Мультимодальная модель на 4 млрд параметров с собственным визуальным токенизатором (Mage-ViT), который избирательно кодирует области видеопотока, богатые движением и остаточной информацией, вместо равномерной выборки кадров, сокращая число визуальных токенов более чем на 75% и обеспечивая до 3.5 раза более быстрый инференс.
Почему это важно
При 4 млрд параметров сравнима с Qwen3-VL-4B на общих VQA-задачах и превосходит значительно более крупную Phi-4-R-V-15B в пространственном и видеопонимании, решая проблему восприятия в реальном времени — известное слабое место VLM-моделей.
Важность: 3/5
Заметная исследовательская статья от Microsoft, посвящённая эффективности мультимодальных моделей, ниже эвристического порога в 100 голосов.
Источники
официальный
Mage-VL