Команда Qwen раскрыла архитектуру Qwen3.8-Next: гибридное внимание, n-gram эмбеддинги, Muon

Qwen (Alibaba)

исследования официальный 2 ист. ~1 мин

Дизайн-статья за Qwen3.8-Flash-Next (125B всего, 6B активных) публикует полные абляции: слои линейного внимания Gated DeltaNet с одним полным attention-слоем на четыре, Qwen Sparse Attention, подменённая на этапе продолженного пре-трейна, четырёхветвевой гейтированный residual-поток и 51 млрд n-gram эмбеддингов, хранимых вне ускорителя. Модель обгоняет предшественника 397B-A17B на 8 из 14 пре-трейн бенчмарков при ~1/9 обучающих FLOPs и показывает, что loss может улучшаться при насыщении downstream-точности.

Почему это важно

Редкое полностью аблированное раскрытие архитектуры от frontier open-weights лаборатории; документирует дизайн архитектуры, превьюрованной Qwen3.8-Flash-Next и, вероятно, унесённой в Qwen4.

Важность: 3/5

Полное раскрытие архитектуры от frontier open-weights лаборатории, официальные источники

Источники