Qwen3.8-Flash-Next выпущена как экспериментальный превью архитектуры Qwen4

Alibaba (Qwen Team)

модели/LLM официальный 5 ист. ~1 мин

Команда Qwen Alibaba открыла исходники Qwen3.8-Flash-Next 24 августа 2026 (HF) / 26 августа 2026 (GitHub) как экспериментальный превью архитектуры, лежащей в основе Qwen4: MoE с 125B суммарно / 6B активных, n-gram таблицей эмбеддингов на 51B параметров, MTP-головой на 4B, гибридным Gated DeltaNet + Qwen Sparse Attention с гранулярностью micro-block, нативным контекстом 262K и расширенным YaRN до 1M токенов. Заявленные бенчмарки: DeepSWE 1.1 58.7, SWE-bench Pro 62.5, SWE-bench Multilingual 81.0, LiveCodeBench v6 91.9, GPQA Diamond 91.7, AndroidWorld 84.5; веса в BF16 и FP8 под qwen-community-1.0 и сервинг-рецепты для SGLang, vLLM и TokenSpeed.

Почему это важно

Это первый публичный сигнал, что Qwen4 будет опираться на гибридное внимание + n-gram эмбеддинги для эффективности на длинном контексте вместо чистого dense или чистого MoE-масштабирования, и позволяет open-weight сообществу прогнать Qwen4-стек до выхода флагмана.

Важность: 3/5

5 источников

Источники

официальный Qwen3.8-Flash-Next — Qwen blog
официальный Qwen3.8-Flash-Next — vLLM Recipes