Cloudflare 決策模型 Clef 上線 Ollama
Cloudflare 的決策模型現已在 Ollama 上提供,可用於影像分類、給 bug 報告打標籤或把支援工單路由到正確團隊。共兩個型號:Clef(27B)用 ollama pull clef 拉取,Clef Flash(9B)用 ollama pull clef-flash 拉取。
Cloudflare 的決策模型現已在 Ollama 上提供,可用於影像分類、給 bug 報告打標籤或把支援工單路由到正確團隊。共兩個型號:Clef(27B)用 ollama pull clef 拉取,Clef Flash(9B)用 ollama pull clef-flash 拉取。
Ollama 官方帳號發布了兩條模型庫連結:Clef Flash 和 Clef,地址分別為 ollama.com/library/clef-flash 與 ollama.com/library/clef。原文未給出模型引數、量化版本、許可或效能資料,具體資訊需開啟頁面檢視。
Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。
Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;
Ollama v0.35.1 新增對 Cloudflare 開源決策模型 Clef(27B)與 Clef Flash(9B)的支援,通過 /v1/systemone 呼叫。兩者支援多模態,請求可同時傳入圖片與文字 state,所有 questions 共享該狀態並聯合打分,返回如 noul 機率 0.958 的答案。
NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;
Ollama 官方 X 帳號發布了一條僅包含 @bespokelabsai 和 @madiator 兩個提及的帖子,沒有附任何說明文字、連結或產品資訊。該帖發布於 2026 年 9 月 30 日,除此之外原文未提供更多可核實的內容。
Ollama 新增 Nimble、Tev1 4b 和 Tev1 0.8b 三款模型,均可通過 /v1/systemone 介面呼叫。模型已發布在 Ollama 官方庫中,使用者可直接拉取使用。
Ollama 在部落格中宣布現已支援 Jev 風格決策模型,並同步上線決策能力文件與 API 文件。使用者可通過 ollama.com/blog 檢視說明,在 docs.ollama.com/capabilities/decision 瞭解決策能力用法,API 細節見 docs.ollama.com/api/systemone。原文未披露具體模型名稱、效能資料與發布時間以外的限制。
Ollama v0.35.0 新增決策模型支援,通過 /v1/systemone 端點呼叫,基於 TypeSafe 的 Jev API。這類模型不返回文字,而是返回選擇、機率和分數,適合工單分流、模型路由和內容分類;目前可用 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1,用 ollama pull nimble 拉取。
v0.35.1-rc0 為 create 請求新增可疊加的 capabilities 欄位,Modelfile 也可直接寫 CAPABILITY 宣告,且這些宣告會在 GGUF 與 safetensors 的建立、繼承和 Modelfile 匯出中保留。排程 System One 請求前改為要求 decision capability,不再靠匹配 Qwen 的架構/renderer 後設資料。
Ollama 0.35 起支援基於 TypeSafe Jev API 的決策模型:通過新的 /v1/systemone 端點,把文字作為 state、配上一組命名問題,本機模型在一次請求裡全部作答,且無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble,以及 Together AI 的實驗性 4B tev1 和 0.8B tev1:0.8b,用 ollama pull 即可下載,可通過 curl 或 TypeSafe 官方 Python SDK 呼叫。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行,無需手動切換。用法與以往一致,例如 ollama pull qwen3.8 後 ollama run qwen3.8。該版本目前為預發布版(v0.40.0-rc0,變更範圍 v0.34.4 到 v0.40.0-rc0),官方稱預發布期間會測試並啟用更多模型,尚未說明具體支援清單與效能差異。
Ollama 於 2026 年 8 月 31 日推出按 token 計費的新 Pro、Max、Team 方案:Pro 每月 20 美元含 60 美元用量,Max 100 美元含 300 美元,Team 500 美元含 1000 美元共享額度且不限使用者數。新方案無服務費,也沒有 5 小時或每週上限,額度用盡後仍按同一 token 單價繼續計費,每月按訂閱起始日重置且不結轉。
Ollama 現在可作為第三方閘道器接入 Claude Desktop,開發者在 Ollama 中開啟 Claude 開關即可自動完成配置。連線後可選任意 Ollama 模型,包括本地執行的開放模型與 Ollama 雲端模型,也能隨時切回 Anthropic 模型;在 Ollama 裡關閉 Claude 即恢復原有設定。
NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。
Muse Glimmer 現已在 Ollama 上線,這是 Meta Superintelligence Labs 發布的首個開放模型。它是 30B 多模態模型,專為本地執行的 agent 工作負載設計,上下文 128K 以上,採用 Apache 2.0 許可,可直接驅動 Claude Code、Codex、Pi、OpenClaw 等。