llama.cpp закрывает удалённо эксплуатируемый use-after-free в RPC-эндпоинте llama-server

ggml

инструменты официальный 1 ист. ~1 мин

Релиз llama.cpp b11000 (16 сентября) исправляет use-after-free в кэшированных RPC-графах, который мог утекать адреса libc и перехватывать vtable, открывая потенциальный remote code execution против развёртываний llama-server RPC. Сборки того же дня также добавляют поддержку CUDA graph для draft-моделей MTP и K-Quant ядра для бэкенда Qualcomm Hexagon.

Почему это важно

llama-server RPC часто выставлен в LAN для многоузлового инференса; уязвимость триггерится удалённо, а не только локально, поэтому развёртываниям следует обновиться.

Важность: 2/5

Удалённо эксплуатируемый security-фикс в широко развёрнутом inference-сервере

Источники

официальный Releases - ggml-org/llama.cpp