llama.cpp v0.5.0 stable: работа над CUDA/Metal-ядрами, video_url в server

инструменты официальный 1 ист. ~1 мин

llama.cpp пометил v0.5.0 (23 сентября): ускорение CUDA conv2d implicit-GEMM, фьюжн Metal MoE и SSM_CONV, привязка сервера к нескольким адресам, поддержка draft-моделей для Gemma4 DSpark, новые модели (MiMo-V2.6, Nemotron MTP/H, Qwen4Exp, HRM-Text/DFM Mimir 1B) и обновление ggml до 0.25.0. Сервер также получил стандартизованный OpenAI тип контента video_url и URI вида data:video/*.

Важность: 2/5

Стабильный мажорный релиз ключевого движка локального инференса

Источники

официальный ggml-org/llama.cpp releases (v0.5.0)