Tencent выпускает Ex-Omni — 11B омни-модальную модель, генерирующую согласованную речь и 3D-анимацию лица
Tencent
HF-организация Tencent опубликовала веса Ex-Omni — 11B омни-модальной модели на базе Qwen3, которая принимает текст или речь и выдаёт текст ответа, речевые юниты и 52-мерные коэффициенты лицевых blendshape для рендеринга говорящего лица. Сопутствующая статья (arXiv 2602.07106) обновлена до v3 3 сентября 2026, представив генератор речевых юнитов с ко-супервизией blendshape, неавторегрессионный blendshape-декодер и датасет InstructS2SF-1200K на 1,2 млн сэмплов.
Почему это важно
Расширяет китайские работы по омни-модальным LLM за пределы текста и аудио в совместную генерацию 3D говорящего лица — область, которая, как отмечает статья, в основном не исследована; веса лежат на официальной HF-организации Tencent (gated, доступ из ЕС запрещён).
Важность: 2/5
Исследовательский артефакт с открытыми весами; нишевое, но новое сочетание модальностей