SGLang v0.5.19 приносит beam search, DeepEP v2 и поддержку Qwen3.8 в 786 PR
SGLang v0.5.19 (5 сентября, 786 PR от 214 контрибьюторов) добавляет Qwen3.8 (2.4T-A95B) и Qwen3.8-27B, а также dots3.note, Ling-3.0, Spark2.5 и Granite 4.2; вводит beam search через `beam_width`, all-to-all-бэкенд DeepEP v2 ElasticBuffer, sequence parallelism для LayerNorm (−3,5% prefill на H100), W4A8 MoE на Hopper, decode context parallelism на дефолтном Blackwell MLA-бэкенде, персистентный Lean attention-кернел на AMD MI300X/MI355X (до 1,52x пропускной способности) и делает unified radix tree кэшем по умолчанию.
Почему это важно
beam search и DeepEP v2 приносят варианты декодирования уровня обучения в production-сервинг
Важность: 2/5
заметный минорный релиз с широкой поддержкой моделей и бэкендов
Источники
официальный
SGLang v0.5.19