llama.cpp b10660 добавляет архитектуру Qwen3.8-Flash-Next (qwen4exp): hyper-connections, gated delta net, MoE, PLE n-gram embedding
llama.cpp
Выпущен 27 августа 2026 года (PR #27742). Добавлена поддержка архитектуры Qwen3.8-Flash-Next (qwen4exp), включая hyper-connections, gated delta net, MoE, PLE n-gram embedding и опциональный indexer key cache в llama_memory_hybrid. В сопутствующих сборках b10656-b10659: ограничение рабочей памяти квантизатора, спекулятивное декодирование DFlash2 с локальной свёрткой, OpenCL-ядра MoE (q4_0_q8_1 и mxfp4_q8_1), бандлинг HIP-runtime DLL на Windows ROCm и CI-изменение, собирающее только ggml-hip бэкенд на windows-rocm.
Почему это важно
Первый inference-рантайм за пределами собственной референсной реализации Qwen, нативно запускающий Qwen3.8-Flash-Next — превью экспериментальной архитектуры Qwen4, освещённое в дайджесте от 2026-08-27 — что делает новую архитектуру сразу запускаемой на Apple Silicon, ROCm, CUDA и CPU.
Важность: 2/5
official confirmation