SenseNova-U1.5: нативный унифицированный визуальный интеллект без энкодеров и VAE

SenseTime

исследования официальный 1 ист. ~1 мин

SenseNova-U1.5 от SenseTime — модель 8B класса mixture-of-transformers, выполняющая визуальное понимание, рассуждение, генерацию и редактирование в одной архитектуре без энкодеров и VAE — ни отдельного vision-энкодера, ни diffusion VAE. Используется пространственно связная reconstruction патчей как визуальный интерфейс, нативное разрешение до 4K и post-training со специализированными экспертами (эстетика, двуязычный рендеринг текста, инфографика, редактирование), объединёнными через multi-expert on-policy distillation. В отчёте показаны улучшения в fidelity, рендеринге текста, редактировании по нескольким референсам и правках с сохранением идентичности; код обучения SFT, RL и on-policy distillation обещано открыть.

Почему это важно

139 апвотов на HuggingFace Daily Papers (11 сентября); убедительный open-weight шаг к полностью нативной унифицированной мультимодальности, убирающий encoder/VAE-обвязку, которую таскает большинство unified-моделей.

Важность: 4/5

Заметная статья со 139 апвотами на HF Daily (буст за >=100 апвотов)

Источники