vLLM v0.27.0 добавляет поддержку Kimi K3 и оптимизации для DeepSeek-V4

vLLM Project

инструменты официальный 1 ист. ~1 мин

vLLM 0.27.0 (561 коммит, 242 контрибьютора) добавляет полноценную поддержку Kimi K3, поддержку новых моделей Qwen3.5 и K-EXAONE-2.0-750B-A37B, оптимизации routing-ядра для DeepSeek-V4, обновление до PyTorch 2.13.0, FlashAttention 4 на SM100 с FP8 KV cache, Model Runner V2 для задач embedding/классификации, а также раннюю поддержку железа NVIDIA Rubin и ROCm gfx1250.

Почему это важно

Крупный релиз, расширяющий покрытие моделей vLLM и производительность инференса для крупномасштабного самостоятельного хостинга.

Важность: 3/5

Заметный релиз: повышение мажорной версии с широкой поддержкой новых моделей и железа, единственный официальный источник.

Источники

официальный vLLM releases