llama.cpp принесла MTP speculative decoding рекуррентным моделям Qwen

ggml

инструменты официальный 1 ист. ~1 мин

В nightly-сборки llama.cpp b10720–b10731 (31 августа — 1 сентября) приземлилась серия по производительности: b10731 добавляет откат рекуррентного состояния для qwen4exp, включая MTP speculative decoding на рекуррентных моделях — декодирование достигает 183 tok/s на коде и 144 tok/s на прозе на Qwen3.8-Flash-Next против 123/83 ранее. Прочие сборки оптимизируют обработку промпта AVX2 IQ-квантов, восстановление KV-cache несмежных ячеек (с 25–63 с до ~0,4 с в продакшен-тесте), тюнинги flash attention для Metal на M1 Ultra и CUDA XOR-swizzle flash attention с фиксом гонки на DGX Spark.

Почему это важно

Speculative decoding раньше был ограничен transformer-подобными моделями; распространение на рекуррентные архитектуры примерно вдвое сокращает разрыв локального инференса для новейших гибридных моделей Qwen на потребительском железе.

Важность: 2/5

Заметная работа по производительности инференса в nightly-сборках, официальные релизы

Источники