llama.cpp v0.5.0 stable: работа над CUDA/Metal-ядрами, video_url в server
llama.cpp пометил v0.5.0 (23 сентября): ускорение CUDA conv2d implicit-GEMM, фьюжн Metal MoE и SSM_CONV, привязка сервера к нескольким адресам, поддержка draft-моделей для Gemma4 DSpark, новые модели (MiMo-V2.6, Nemotron MTP/H, Qwen4Exp, HRM-Text/DFM Mimir 1B) и обновление ggml до 0.25.0. Сервер также получил стандартизованный OpenAI тип контента video_url и URI вида data:video/*.
Важность: 2/5
Стабильный мажорный релиз ключевого движка локального инференса
Источники
официальный
ggml-org/llama.cpp releases (v0.5.0)