Wuhan AI Lab открывает ZDTaichu5.0-9B — VLM для пространственного рассуждения менее 10B параметров
Wuhan Artificial Intelligence Research Institute (Taichu)
Taichu выпустила ZDTaichu5.0-9B — открытую мультимодальную модель, сочетающую языковой бэкбон Qwen3.5-9B с визуальным энкодером C-RADIOv4-H для изображений, видео и текста с контекстом 128K. Заявлены лидерские результаты пространственного рассуждения среди VLM до 10B (SparBench, ViewSpatial, MMSI-Bench), плюс агентные показатели (TAU2-Bench 87.7) и энтропийно-гейтированное адаптивное рекуррентное рассуждение, выделяющее дополнительное латентное вычисление сложным токенам; веса и FP8-сборка — на Hugging Face, код — на GitHub.
Почему это важно
Объединяет пространственное рассуждение, grounding для embodied-AI и работу с инструментами в одной открытой малой модели — практичная база для робототехники и on-device агентов, а не узкий vision-специалист.
Важность: 2/5
Заметный релиз открытой VLM до 10B параметров с сильными заявками по пространственному рассуждению