Ollama 自 2026 年 10 月 4 日起陸續發布 v0.40.0 的說明,宣布在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行,無需手動切換。官方給出的範例是 ollama pull qwen3.8 與 ollama run qwen3.8。隨後幾天的說明逐步補充了… 看完整事件
Ollama v0.40.0:Apple Silicon 預設用 MLX 執行模型
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8,其他可用模型還包括 gemma4、qwen3.6 和 qwen3.5;決策模型 Nimble、tev1、clef、clef-flash 也已支援 MLX,並新增嵌入模型 embeddinggemma-2 支援。官方表示會繼續測試並啟用更多模型。
Ollama 把 Apple Silicon 上受 MLX 支援的模型預設切到 MLX 執行,並給出 qwen3.8、gemma4 等可用模型清單與新增嵌入模型支援,對在 Mac 本地跑模型的人最有用。
原標題:v0.40.0
閱讀原文
| 評分 | 82 / 82(平均 82,門檻 60) |
|---|---|
| 狀態 | 精選 |
全文翻譯
由 AI 翻譯,以原文為準。
原文
相關報導
Ollama v0.40.0-rc6 在 MLX 上加入多模態嵌入
Ollama 發布 v0.40.0-rc6,在 MLX runner 上實現 EmbeddingGemma2Model 架構,使本地嵌入支援多模態輸入。/api/embed 介面現在可通過 input dict 為每個條目單獨傳入媒體。該模型為 24 層雙向文字編碼器,帶 PLE,共享 gemma4 的視覺與音訊塔,輸出經 mean-pool 與 L2 歸一化。該標籤由 pdevine 於 10 月 6 日打上,對應提交 #18820,仍屬 rc 預發布版本。
Ollama v0.35.1 支援 Cloudflare 決策模型 Clef
Ollama 發布 v0.35.1,通過 /v1/systemone 介面支援 Cloudflare 新開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可在文字 state 之外附帶圖片,所有問題共享該狀態並聯合打分。同一版本把聯網搜尋上限從每次回應 3 次提高到 10 次,Modelfile 新增 CAPABILITY 宣告,並更新了 llama.cpp 與 MLX 引擎。
Ollama 預告接入 Reflection AI 新開源模型
Ollama 官方帳號表示期待 Reflection AI 的新開源模型,並稱將有更多美國模型進入 Ollama。該帖未給出模型名稱、引數規模、發布時間與具體接入方式。
llama.cpp 新增 nimble 決策模型支援
llama.cpp 發布 b11364 版本,新增對 nimble 決策模型的支援(PR #29844)。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL、Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端建置;
llama.cpp b11447 發布:新增 pplx-decider 模型支援
llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;