#cuda
- Qualcomm приобретает Modular за $3,92 млрд для противостояния привязке к CUDA Qualcomm industry
- Hugging Face Transformers: асинхронный continuous batching даёт прирост скорости инференса на 22% Hugging Face tools
- llama.cpp v0.3.0 — первый помеченный стабильный релиз ночного b10621; мультимодальность dots3-note, MTP для GLM-4.5-Air, tensor-split DeepSeek 4, ggml v0.22.0 ggml-org tools
- llama.cpp b9589–b9592: исправление синхронизации CUDA SSM и оптимизация памяти Mamba tools
- Ollama v0.31.2: ядро small-batch matmul для MLX, llama.cpp сборка 9840, обновления CUDA tools
- Dharma-AI поднимает утилизацию GPU-кластера с 53,6% до 87,0%, кодируя физические ограничения в планировщик Dharma-AI tools