Mage-VL: эффективная codec-native стриминговая мультимодальная базовая модель

Microsoft

исследования официальный 2 ист. ~1 мин

Исследователи Microsoft представили Mage-VL, vision-language модель на 4B параметров с визуальным энкодером (Mage-ViT), обученным с нуля на 560M изображений и 100M видеокадров. Модель использует codec-guided разреженный отбор токенов, заимствуя структуру I-frame/P-frame из видеокодеков, что сокращает число визуальных токенов примерно на 75% по сравнению с плотной выборкой кадров и даёт до 3,5-кратного ускорения инференса по реальному времени. Двухсистемный дизайн сочетает лёгкий стриминговый gate с полноценным reasoning-декодером; модель соответствует Qwen3-VL-4B на статическом VQA, превосходя её в понимании видео и пространственном рассуждении.

Почему это важно

Работа нацелена на реальное узкое место в деплое — стоимость инференса для видео и стриминга в реальном времени — вместо погони исключительно за бенчмарковыми показателями, и утверждает, что веб-масштабное предобучение не является обязательным для визуального энкодера.

Важность: 2/5

Исследование от крупной лаборатории, ориентированное на эффективность мультимодальных моделей.

Источники

официальный microsoft/Mage-VL model card