Волна llama.cpp за 1–2 сентября: +4,9% к генерации от фикса n-gram-поиска, слитый CUDA-редукшн для MoE
ggml
В b10739-b10753 (1–2 сентября) llama.cpp получила фикс n-gram-поиска по KV-кэшу, использующий индекс позиции в последовательности — генерация текста на одной модели Qwen3 выросла с 69,3 до 72,7 tok/s (+4,9%) при контексте 71k (b10750) — плюс слитый CUDA-кернел взвешенной экспертной редукции для MoE с k=2..15 экспертами, снижающий трафик глобальной памяти (b10751). Остальное — работа над Metal: настройка fa-vec для M2 Pro, M2 Max и A18 Pro, фиксы утечек autoreleasepool и поддержка сборки metallib в xcframework (b10752).
Почему это важно
Бесплатный прирост скорости генерации для локального инференса с длинным контекстом
Важность: 2/5
Измеримые выигрыши производительности для локального инференса
Источники
официальный
llama.cpp releases (b10739-b10753)