SenseNova-U1.5: нативный унифицированный визуальный интеллект без энкодеров и VAE
SenseTime
SenseNova-U1.5 от SenseTime — модель 8B класса mixture-of-transformers, выполняющая визуальное понимание, рассуждение, генерацию и редактирование в одной архитектуре без энкодеров и VAE — ни отдельного vision-энкодера, ни diffusion VAE. Используется пространственно связная reconstruction патчей как визуальный интерфейс, нативное разрешение до 4K и post-training со специализированными экспертами (эстетика, двуязычный рендеринг текста, инфографика, редактирование), объединёнными через multi-expert on-policy distillation. В отчёте показаны улучшения в fidelity, рендеринге текста, редактировании по нескольким референсам и правках с сохранением идентичности; код обучения SFT, RL и on-policy distillation обещано открыть.
Почему это важно
139 апвотов на HuggingFace Daily Papers (11 сентября); убедительный open-weight шаг к полностью нативной унифицированной мультимодальности, убирающий encoder/VAE-обвязку, которую таскает большинство unified-моделей.
Важность: 4/5
Заметная статья со 139 апвотами на HF Daily (буст за >=100 апвотов)