Ollama v0.34.1 выводит создание MLX-моделей из safetensors из эксперимента и ускоряет /api/tags в десять раз
Ollama
Ollama v0.34.1 (14 сентября) делает создание моделей из MLX safetensors через `ollama create` неэкспериментальным, улучшает управление памятью MLX на Apple Silicon и сокращает холодный ответ /api/tags с ~3,1 с до 294 мс на больших библиотеках моделей. Создание GGUF-моделей теперь требует инструментов llama.cpp для конвертации safetensors, а typical_p объявлен устаревшим при создании новых моделей. v0.34.2-rc0 (15 сентября) обновляет llama.cpp.
Почему это важно
Стабилизация создания MLX-моделей превращает Apple Silicon в полноценный путь для сборки и квантизации локальных моделей внутри Ollama.
Важность: 2/5
Минорная версия с заметным улучшением качества жизни для пользователей Apple Silicon
Источники
официальный
ollama/ollama releases: v0.34.1