Ночные сборки llama.cpp b10668-b10679 содержат исправление wrong-token в Vulkan

llama.cpp

инструменты официальный 1 ист. ~1 мин

Десять ночных сборок llama.cpp вышли 28 августа (b10668-b10679). Самая значимая — b10677: исправление Vulkan-бэкенда для отсутствующих зависимостей view-alias в ggml_vk_graph_optimize, которое, по сообщениям, приводило к неверным токенам при greedy-декодировании на AMD/NVIDIA Vulkan. Остальные добавляют тюнинг FlashAttention-Vector Metal для M3 Max/M4/M5, OpenVINO 2026.3.1 с поддержкой whisper.cpp и NPU Qwen3.5, а также сокращение разбиения графа для Qwen4-Exp.

Почему это важно

исправление корректности для «тихого» бага Vulkan с неверным выводом

Важность: 2/5

цикл ночных патчей, но реальное исправление неверного вывода

Источники

официальный llama.cpp releases (b10668-b10679)