llama.cpp закрывает удалённо эксплуатируемый use-after-free в RPC-эндпоинте llama-server
ggml
Релиз llama.cpp b11000 (16 сентября) исправляет use-after-free в кэшированных RPC-графах, который мог утекать адреса libc и перехватывать vtable, открывая потенциальный remote code execution против развёртываний llama-server RPC. Сборки того же дня также добавляют поддержку CUDA graph для draft-моделей MTP и K-Quant ядра для бэкенда Qualcomm Hexagon.
Почему это важно
llama-server RPC часто выставлен в LAN для многоузлового инференса; уязвимость триггерится удалённо, а не только локально, поэтому развёртываниям следует обновиться.
Важность: 2/5
Удалённо эксплуатируемый security-фикс в широко развёрнутом inference-сервере
Источники
официальный
Releases - ggml-org/llama.cpp