llama.cpp v0.4.0: lazy-чтение тензоров, лимиты контекста per-slot, видео-вход

инструменты официальный 1 ист. ~1 мин

llama.cpp выпустил v0.4.0 4 сентября, добавив ленивое чтение тензоров по требованию, серверные лимиты контекста per-slot, опции видео-входа и подъём ggml с 0.22.0 до 0.23.0, вместе с поддержкой новых моделей Qwen3.8-Flash-Next и Nemotron-3-Puzzle. В тот же день вышло десять тегированных сборок, включая тюнинги Metal fa-vec для M3 Max и OpenCL-пути Adreno SDPA.

Почему это важно

Lazy-загрузка тензоров снижает память холодного старта для больших моделей на потребительском железе — ощутимый выигрыш для пользователей локального инференса.

Важность: 3/5

Мажорное обновление референсного движка локального инференса

Источники