llama.cpp v0.4.0: lazy-чтение тензоров, лимиты контекста per-slot, видео-вход
llama.cpp выпустил v0.4.0 4 сентября, добавив ленивое чтение тензоров по требованию, серверные лимиты контекста per-slot, опции видео-входа и подъём ggml с 0.22.0 до 0.23.0, вместе с поддержкой новых моделей Qwen3.8-Flash-Next и Nemotron-3-Puzzle. В тот же день вышло десять тегированных сборок, включая тюнинги Metal fa-vec для M3 Max и OpenCL-пути Adreno SDPA.
Почему это важно
Lazy-загрузка тензоров снижает память холодного старта для больших моделей на потребительском железе — ощутимый выигрыш для пользователей локального инференса.
Важность: 3/5
Мажорное обновление референсного движка локального инференса