vLLM v0.29.0 делает Model Runner V2 дефолтной и добавляет prefix caching для Mamba

vLLM

инструменты официальный 1 ист. ~1 мин

vLLM v0.29.0 (9 сентября, 594 коммита от 277 контрибьюторов) делает Model Runner V2 дефолтом для всех моделей, добавляет поддержку новых моделей (Qwen3.8-Flash-Next, Kimi K3 NVFP4, NemotronH_Omni_Reasoning_V3, GraniteSWA) и улучшает speculative decoding с per-request статистикой принятия и адаптивной logprob-верификацией. Prefix caching для Mamba даёт улучшение TTFT на 9–25%. Критические изменения: удалены десять устаревших архитектур, удалён декодер PyAV, а 'vllm serve' заменяет python -m vllm.entrypoints.openai.api_server.

Почему это важно

Model Runner V2 в качестве дефолта — крупнейшее изменение serving-стека за месяцы; всем, кто обновляется, стоит проверить список удалённых архитектур перед деплоем.

Важность: 2/5

Крупный релиз serving-стека с breaking changes

Источники

официальный vLLM releases — v0.29.0