#llama-cpp
- llama.cpp, сборки от 16 июня: спекулятивное декодирование Eagle3, память Vulkan UMA, исправления NVFP4 tools
- llama.cpp b9754: прогресс загрузки модели в реальном времени через SSE и PEG-парсер грамматик tools
- llama.cpp b9830–b9837: DFlash v2, парсер MiniCPM5, флаг --reasoning-preserve ggml-org tools
- Ollama v0.31.2: ядро small-batch matmul для MLX, llama.cpp сборка 9840, обновления CUDA tools
- llama.cpp b9967–b9969: ускорение на GPU Adreno и null-сэмплинг, совместимый с OpenAI tools
- llama.cpp: поддержка Tencent Hunyuan 3, спекулятивное декодирование Minimax2 Eagle3 и SYCL Fused MoE tools