Qwen выпускает Qwen-Drive-1.0 — открытую vision-language модель для автономного вождения
Qwen/Alibaba
Команда Qwen открыла под Apache-2.0 Qwen-Drive-1.0-4B: замороженную Qwen3.5-4B VLM с присоединённой BEV-головой восприятия (3D-детекция, occupancy, сегментация карты) и planning-экспертом на flow matching с чекпоинтами SFT и RL. Модель показывает NAVSIM PDMS 90,7 (91,4 best-of-6), WOD-E2E RFS 8,45 и лучшие в таблице результаты по driving-VQA, почти не деградируя в общих VLM-задачах (MMMU 72,7). Веса появились на HuggingFace в конце августа, arXiv-статья — 31 августа; широкое освещение последовало 7 сентября.
Почему это важно
Первая открытая универсальная VLM от крупной китайской лаборатории, нацеленная end-to-end на вождение (восприятие + планирование), и одна из первых попыток сохранить общие мультимодальные навыки в модели, специализированной на вождении, — шаблон, на котором другие AV-команды могут строить свои решения бесплатно.
Важность: 3/5
Заметный open-weights релиз: первая специализированная на вождении VLM от крупной китайской лаборатории, полные веса и статья