-
Google DeepMind публикует QAT-чекпоинты Gemma 4: модель E2B занимает менее 1 ГБ на устройстве
Google DeepMind
models-llm
-
Ollama v0.33.2 (pre-release) восстанавливает системную тёмную тему и поддерживает работу прокси при изменениях каталога моделей
Ollama
tools
-
Ollama v0.24.0: интеграция с Codex App и улучшения MLX-семплера
Ollama
tools
-
llama.cpp b9161/b9169: совместимость с Codex CLI и мультимодальная поддержка Qwen3A
ggml-org
tools
-
Ollama v0.30.7: поддержка Hermes Desktop, Gemma 4 QAT и Nemotron-3-Ultra
Ollama
tools
-
llama.cpp b9589–b9592: исправление синхронизации CUDA SSM и оптимизация памяти Mamba
tools
-
Ollama v0.30.9: поддержка Cohere2Moe, исправлен баг с одиночным токеном в coding-агентах
tools
-
llama.cpp, сборки от 16 июня: спекулятивное декодирование Eagle3, память Vulkan UMA, исправления NVFP4
tools
-
Ollama v0.31.1: Gemma 4 почти на 90% быстрее на Apple Silicon через MTP
Ollama
tools
-
Ollama v0.31.2: ядро small-batch matmul для MLX, llama.cpp сборка 9840, обновления CUDA
tools
-
llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark
llama.cpp (GGML)
tools
-
Ollama v0.33.1: поддержка Qwen3.8 Flash Next и structured-output в mlxrunner
Ollama
tools
-
llama.cpp v0.4.1 добавляет поддержку Maple 20B, Tencent Hy 4 и Spark2.5
ggml
tools
-
llama.cpp закрывает удалённо эксплуатируемый use-after-free в RPC-эндпоинте llama-server
ggml
tools
-
llama.cpp v0.5.0 stable: работа над CUDA/Metal-ядрами, video_url в server
tools
-
Ollama v0.34.4 pre-release: исправления флака model-not-found и структурированных выводов thinking-моделей
tools