#serving
- MinT: управляемая инфраструктура для обучения и обслуживания миллионов LLM Mind Lab research
- vLLM v0.25.0: Model Runner V2 по умолчанию, PagedAttention выведен, паритет с Transformers backend tools
- vLLM добавляет поддержку MiniMax M3 с открытыми весами в день выхода: разреженное внимание с контекстом 1M токенов MiniMax tools
- vLLM v0.24.0: Model Runner V2 по умолчанию, Rust-фронтенд, ускорение SM90 FP8 vLLM tools
- vLLM v0.27.0 добавляет поддержку Kimi K3 и оптимизации для DeepSeek-V4 vLLM Project tools
- Modal запускает Auto Endpoints для производственного LLM-инференса на базе open-source-моделей Modal tools
- ELDR: маршрутизация с учётом локальности экспертов снижает задержку при обслуживании MoE-моделей на 14% Microsoft Research research
- Dharma-AI поднимает утилизацию GPU-кластера с 53,6% до 87,0%, кодируя физические ограничения в планировщик Dharma-AI tools
- Groq закрывает раунд Series A на $350 млн для строительства облака AI-инференса Groq industry
- SGLang v0.5.18 lands major model and perf updates tools
- SGLang v0.5.18 SGLang tools