llama.cpp принесла MTP speculative decoding рекуррентным моделям Qwen
ggml
В nightly-сборки llama.cpp b10720–b10731 (31 августа — 1 сентября) приземлилась серия по производительности: b10731 добавляет откат рекуррентного состояния для qwen4exp, включая MTP speculative decoding на рекуррентных моделях — декодирование достигает 183 tok/s на коде и 144 tok/s на прозе на Qwen3.8-Flash-Next против 123/83 ранее. Прочие сборки оптимизируют обработку промпта AVX2 IQ-квантов, восстановление KV-cache несмежных ячеек (с 25–63 с до ~0,4 с в продакшен-тесте), тюнинги flash attention для Metal на M1 Ultra и CUDA XOR-swizzle flash attention с фиксом гонки на DGX Spark.
Почему это важно
Speculative decoding раньше был ограничен transformer-подобными моделями; распространение на рекуррентные архитектуры примерно вдвое сокращает разрыв локального инференса для новейших гибридных моделей Qwen на потребительском железе.
Важность: 2/5
Заметная работа по производительности инференса в nightly-сборках, официальные релизы