Tencent выпускает мультимодальные модели эмбеддингов WeMM-Embedding (2B/4B/9B) — новый SOTA на MMEB-v2/v3

Tencent

модели/LLM офиц. + СМИ 7 ист. ~1 мин

Tencent опубликовала семейство WeMM-Embedding — универсальную мультимодальную модель эмбеддингов с размерами 2B/4B/9B параметров, дообученную из Qwen3.5-2B/4B/9B-Base — 25 августа 2026 года. Технический отчёт (arXiv:2608.24053) описывает двухэтапный пайплайн обучения (масштабное мультимодальное выравнивание, затем уточнение на курированных данных, тонкая релевантность-супервизия и кросс-размерный перенос знаний). Входы охватывают текст, изображения, видео, визуальные документы и чередующийся мультимодальный контент (без аудио). Выходы — L2-нормализованные эмбеддинги с поддержкой Matryoshka (2B → 2 048-мерные; 4B → 2 560-мерные; 9B → 4 096-мерные). WeMM-Embedding-9B устанавливает новый state-of-the-art на MMEB-v2 со средним баллом 80,6 (Image 81,9 / Video 74,3 / VisDoc 83,3) и лидирует на MMEB-v3 V3-All с 59,5 — опережая Qwen3-VL-Embedding-8B (53,5) и Tianmu-Emb-Uni-8B (53,3). Вариант 2B уже превосходит прежний 8B open-source baseline на MMEB-v2. Развёртывание поддерживается в vLLM 0.27.0 (pooling runner) и SGLang 0.5.9. В отчёте заявлено масштабное развёртывание в WeChat Channels, Official Accounts, Moments и e-commerce-сервисах, с 14 онлайн A/B-тестами и внутренним бенчмарком на 26 задач.

Почему это важно

Первый крупный open-weights релиз мультимодальных эмбеддингов от ведущей китайской лаборатории после Qwen3-VL-Embedding ранее в 2026 году, и первый, поставляющийся в трёх размерах (2B/4B/9B) с полными весами Apache-2.0 и подробным техническим отчётом. Закрепляет Tencent в открытой гонке мультимодальных эмбеддингов наряду с Qwen и Alibaba и сигнализирует, что продуктовая поверхность WeChat (поиск, рекомендации, e-commerce) теперь используется как реальный полигон для модели — доказательная база A/B-тестов и отличает релиз от чисто академических baseline'ов.

Важность: 5/5

сигнал парадигмы/SOTA, крупный релиз, ≥4 подтверждения

Источники