#local-inference
- Google выпускает DiffusionGemma: открытая модель на 26B с генерацией текста в 4× быстрее Google DeepMind models-llm
- PrismML выпускает Bonsai 2 27B: тернарные веса с потерями, близкими к нулевым, относительно учителя PrismML models-llm
- Стек CUDA-for-AMD-on-Windows запускает CUDA-приложения на Radeon через ZLUDA tools
- llama.cpp b9754: прогресс загрузки модели в реальном времени через SSE и PEG-парсер грамматик tools
- llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark llama.cpp (GGML) tools
- llama.cpp b10660 добавляет архитектуру Qwen3.8-Flash-Next (qwen4exp): hyper-connections, gated delta net, MoE, PLE n-gram embedding llama.cpp tools
- Ollama v0.34.0-rc1: локальные модели можно использовать прямо в ChatGPT Desktop tools