-
llama.cpp v0.3.0 — первый помеченный стабильный релиз ночного b10621; мультимодальность dots3-note, MTP для GLM-4.5-Air, tensor-split DeepSeek 4, ggml v0.22.0
ggml-org
tools
-
llama.cpp v0.4.0: lazy-чтение тензоров, лимиты контекста per-slot, видео-вход
tools
-
llama.cpp, сборки от 16 июня: спекулятивное декодирование Eagle3, память Vulkan UMA, исправления NVFP4
tools
-
llama.cpp b9754: прогресс загрузки модели в реальном времени через SSE и PEG-парсер грамматик
tools
-
llama.cpp b9830–b9837: DFlash v2, парсер MiniCPM5, флаг --reasoning-preserve
ggml-org
tools
-
Ollama v0.31.2: ядро small-batch matmul для MLX, llama.cpp сборка 9840, обновления CUDA
tools
-
llama.cpp b9967–b9969: ускорение на GPU Adreno и null-сэмплинг, совместимый с OpenAI
tools
-
llama.cpp: поддержка Tencent Hunyuan 3, спекулятивное декодирование Minimax2 Eagle3 и SYCL Fused MoE
tools
-
llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark
llama.cpp (GGML)
tools
-
llama.cpp rolls up Aug 22 backend and model fixes
tools
-
llama.cpp b10603-b10615 — GLM-4.5-Air MTP, Deepseek 4 -sm tensor, тюнинг Metal flash-attn vec для M1 Pro/M2 Ultra/M5 Max
ggml-org
tools
-
llama.cpp b10660 добавляет архитектуру Qwen3.8-Flash-Next (qwen4exp): hyper-connections, gated delta net, MoE, PLE n-gram embedding
llama.cpp
tools
-
Ночные сборки llama.cpp b10668-b10679 содержат исправление wrong-token в Vulkan
llama.cpp
tools
-
llama.cpp принесла MTP speculative decoding рекуррентным моделям Qwen
ggml
tools
-
Волна llama.cpp за 1–2 сентября: +4,9% к генерации от фикса n-gram-поиска, слитый CUDA-редукшн для MoE
ggml
tools
-
llama.cpp v0.4.1 добавляет поддержку Maple 20B, Tencent Hy 4 и Spark2.5
ggml
tools
-
llama.cpp закрывает удалённо эксплуатируемый use-after-free в RPC-эндпоинте llama-server
ggml
tools