llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark

llama.cpp (GGML)

инструменты официальный 1 ист. ~1 мин

Работа 18 августа охватывает pre-release v0.1.2 (синхронизация ggml с 0.20.2, документация MCP stdio + CORS-дефолты, целочисленные оценки токенизатора, рефакторинг именования Built-In Tools), b10488 (OpenVINO 2026.3), b10486 (исправление порога тайлинга изображений LFM2), b10485 (синхронизация ggml) и b10483 (cmake alias-таргеты vendor::). 17 августа добавлены b10472 (переопределение пропуска CUDA UMA для HIP, #18159), b10470 (release.yml явно пушит тег), b10456 (SYCL q4_0→f32 с 20,21 до 158,19 GB/s на Arc 70) и b10455 (SYCL OPT_STEP_ADAMW/SGD).

Почему это важно

Исправление ядра квантованного копирования SYCL даёт ~8-кратный прирост пропускной способности для q4_0→f32 на GPU Arc — одно изменение ядра существенно меняет то, как выглядит локальный инференс на дискретных картах Intel. OpenVINO 2026.3 и тюнинг CUDA MMVQ для DGX Spark также расширяют матрицу развёртывания.

Важность: 2/5

default

Источники