vLLM v0.28.0: перф-улучшения Kimi-K3, полная поддержка sparse-MLA DeepSeek-V4, зрелость Model Runner V2 и многоуровневая выгрузка KV-кэша

vLLM Project

инструменты официальный 1 ист. ~1 мин

Выпущен 28 августа 2026 года. 584 коммита от 270 контрибьюторов. Главное: context parallel в декодировании для Kimi-K3, объединённые ядра FlashKDA, активация SiTU для MegaMoE, sequence parallelism GEMM-RS, улучшение TTFT у DSpark примерно на 60% за счёт адаптивного спекулятивного бюджета; добавлена поддержка ROCm. DeepSeek-V4: сквозной sparse MLA для декодирования, MTP, DSpark; AMD Quark NVFP4; маппинги уровней рассуждений. Спекулятивное декодирование: DFlash2 с локальной свёрткой, confidence-планирование для DSpark. Model Runner V2: разделение E/P/D, выгрузка весов, многослойный MTP KV-кэш, CUDA-графы для энкодера, модели без внимания. Многоуровневая выгрузка KV-кэша с дисковым уровнем, OOT-менеджеры вторичных уровней, частичные результаты загрузки, метрики распределения по уровням. Frontend на Rust/gRPC получает мультимодальный инференс изображений и protobuf-схемы на Buf. Новые значения по умолчанию: max_num_batched_tokens с 8192 до 16384, prefix caching включён для Mamba, захват Blackwell CUDA graph — 1024. Ломающие изменения: bitsandbytes вынесен в OOT-плагин, базовая версия Transformers 5.15.0, calculate_kv_scales и override_attention_dtype удалены. Онлайн MXFP4/NVFP4; CPU-бэкенд MLA для DeepSeek-V2/V3.

Почему это важно

Крупнейший августовский релиз vLLM и первый, где новый стек Model Runner V2, полноценная многоуровневая выгрузка KV и перф Kimi-K3 в день-один стабильны вместе; DeepSeek-V4 со сквозным sparse MLA + DSpark делает vLLM фактическим inference-рантаймом для свежего китайского MoE-уровня.

Важность: 4/5

flagship release; official confirmation

Источники

официальный vLLM v0.28.0 release