Intern-S2-Mobius: фундаментальная модель с разделёнными знаниями и рассуждением

Shanghai AI Lab

исследования офиц. + СМИ 2 ист. ~1 мин

Предлагает архитектуру Mobius-v0: глобально разделяемая Memory (FFN) хранит векторы знаний, а несколько модулей Reasoner (Self-Attention) итеративно запрашивают её через скрытые состояния. Модель 7B, обученная с нуля, достигает уровня Transformer-базлайна при 62,6% объёма данных, а Intern-S2-Mobius, прошедшая продолженное предобучение с инициализацией из Qwen3.5-35B, соответствует её показателям на downstream-задачах, обеспечивая почти 4-кратное ускорение end-to-end инференса.

Почему это важно

HF: 23 голоса 17 августа; конкретное разделение знаний и рассуждения с измеренным 4-кратным ускорением инференса при паритете качества.

Важность: 2/5

default

Источники

официальный arXiv:2608.14290