Ночные сборки llama.cpp b10668-b10679 содержат исправление wrong-token в Vulkan
llama.cpp
Десять ночных сборок llama.cpp вышли 28 августа (b10668-b10679). Самая значимая — b10677: исправление Vulkan-бэкенда для отсутствующих зависимостей view-alias в ggml_vk_graph_optimize, которое, по сообщениям, приводило к неверным токенам при greedy-декодировании на AMD/NVIDIA Vulkan. Остальные добавляют тюнинг FlashAttention-Vector Metal для M3 Max/M4/M5, OpenVINO 2026.3.1 с поддержкой whisper.cpp и NPU Qwen3.5, а также сокращение разбиения графа для Qwen4-Exp.
Почему это важно
исправление корректности для «тихого» бага Vulkan с неверным выводом
Важность: 2/5
цикл ночных патчей, но реальное исправление неверного вывода
Источники
официальный
llama.cpp releases (b10668-b10679)