Команда Qwen раскрыла архитектуру Qwen3.8-Next: гибридное внимание, n-gram эмбеддинги, Muon
Qwen (Alibaba)
Дизайн-статья за Qwen3.8-Flash-Next (125B всего, 6B активных) публикует полные абляции: слои линейного внимания Gated DeltaNet с одним полным attention-слоем на четыре, Qwen Sparse Attention, подменённая на этапе продолженного пре-трейна, четырёхветвевой гейтированный residual-поток и 51 млрд n-gram эмбеддингов, хранимых вне ускорителя. Модель обгоняет предшественника 397B-A17B на 8 из 14 пре-трейн бенчмарков при ~1/9 обучающих FLOPs и показывает, что loss может улучшаться при насыщении downstream-точности.
Почему это важно
Редкое полностью аблированное раскрытие архитектуры от frontier open-weights лаборатории; документирует дизайн архитектуры, превьюрованной Qwen3.8-Flash-Next и, вероятно, унесённой в Qwen4.
Важность: 3/5
Полное раскрытие архитектуры от frontier open-weights лаборатории, официальные источники