Wuhan AI Lab открывает ZDTaichu5.0-9B — VLM для пространственного рассуждения менее 10B параметров

Wuhan Artificial Intelligence Research Institute (Taichu)

модели/LLM офиц. + СМИ 3 ист. ~1 мин

Taichu выпустила ZDTaichu5.0-9B — открытую мультимодальную модель, сочетающую языковой бэкбон Qwen3.5-9B с визуальным энкодером C-RADIOv4-H для изображений, видео и текста с контекстом 128K. Заявлены лидерские результаты пространственного рассуждения среди VLM до 10B (SparBench, ViewSpatial, MMSI-Bench), плюс агентные показатели (TAU2-Bench 87.7) и энтропийно-гейтированное адаптивное рекуррентное рассуждение, выделяющее дополнительное латентное вычисление сложным токенам; веса и FP8-сборка — на Hugging Face, код — на GitHub.

Почему это важно

Объединяет пространственное рассуждение, grounding для embodied-AI и работу с инструментами в одной открытой малой модели — практичная база для робототехники и on-device агентов, а не узкий vision-специалист.

Важность: 2/5

Заметный релиз открытой VLM до 10B параметров с сильными заявками по пространственному рассуждению

Источники

официальный ZDTaichu5.0-9B model card
официальный Taichu-AI/ZDTaichu5.0-9B on GitHub