vLLM v0.29.0 делает Model Runner V2 дефолтной и добавляет prefix caching для Mamba
vLLM
vLLM v0.29.0 (9 сентября, 594 коммита от 277 контрибьюторов) делает Model Runner V2 дефолтом для всех моделей, добавляет поддержку новых моделей (Qwen3.8-Flash-Next, Kimi K3 NVFP4, NemotronH_Omni_Reasoning_V3, GraniteSWA) и улучшает speculative decoding с per-request статистикой принятия и адаптивной logprob-верификацией. Prefix caching для Mamba даёт улучшение TTFT на 9–25%. Критические изменения: удалены десять устаревших архитектур, удалён декодер PyAV, а 'vllm serve' заменяет python -m vllm.entrypoints.openai.api_server.
Почему это важно
Model Runner V2 в качестве дефолта — крупнейшее изменение serving-стека за месяцы; всем, кто обновляется, стоит проверить список удалённых архитектур перед деплоем.
Важность: 2/5
Крупный релиз serving-стека с breaking changes
Источники
официальный
vLLM releases — v0.29.0