Ollama v0.34.1 выводит создание MLX-моделей из safetensors из эксперимента и ускоряет /api/tags в десять раз

Ollama

инструменты официальный 1 ист. ~1 мин

Ollama v0.34.1 (14 сентября) делает создание моделей из MLX safetensors через `ollama create` неэкспериментальным, улучшает управление памятью MLX на Apple Silicon и сокращает холодный ответ /api/tags с ~3,1 с до 294 мс на больших библиотеках моделей. Создание GGUF-моделей теперь требует инструментов llama.cpp для конвертации safetensors, а typical_p объявлен устаревшим при создании новых моделей. v0.34.2-rc0 (15 сентября) обновляет llama.cpp.

Почему это важно

Стабилизация создания MLX-моделей превращает Apple Silicon в полноценный путь для сборки и квантизации локальных моделей внутри Ollama.

Важность: 2/5

Минорная версия с заметным улучшением качества жизни для пользователей Apple Silicon

Источники

официальный ollama/ollama releases: v0.34.1