llama.cpp 新增 nimble 決策模型支援
llama.cpp 合併 PR #29844,新增對 nimble 決策模型的支援。該版本覆蓋 macOS Apple Silicon(arm64)、Ubuntu、Windows、Android 等多平台建置,其中 macOS Apple Silicon 的 KleidiAI 加速版本被標記為 DISABLED。官方發布頁為 llama.app,建置證明見 GitHub attestations。
llama.cpp 合併 PR #29844,新增對 nimble 決策模型的支援。該版本覆蓋 macOS Apple Silicon(arm64)、Ubuntu、Windows、Android 等多平台建置,其中 macOS Apple Silicon 的 KleidiAI 加速版本被標記為 DISABLED。官方發布頁為 llama.app,建置證明見 GitHub attestations。
Cloudflare 的決策模型現已在 Ollama 上提供,可用於影像分類、給 bug 報告打標籤或把支援工單路由到正確團隊。共兩個型號:Clef(27B)用 ollama pull clef 拉取,Clef Flash(9B)用 ollama pull clef-flash 拉取。
Ollama 官方帳號發布了兩條模型庫連結:Clef Flash 和 Clef,地址分別為 ollama.com/library/clef-flash 與 ollama.com/library/clef。原文未給出模型引數、量化版本、許可或效能資料,具體資訊需開啟頁面檢視。
llama.cpp 合併 PR #29570,在 Metal 後端新增基於 tensor API 的 flash attention 核心,支援 F16 KV 快取。同一批提交還補充了 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等形狀的 tensor FA 核心,並支援 attention sinks、ALiBi 與 logit softcap。
llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;
llama.cpp 發布 b11355 版:對共享記憶體為 32KB 的三星 GPU,Vulkan 後端停用大型 matmul tile(#28531),該提交由 Claude Op 協助完成。此版本中 macOS Apple Silicon 的 KleidiAI 啟用建置(arm64, KleidiAI enabled)與 openEuler 建置標記為 DISABLED;
r/LocalLLaMA 使用者分享 jev 系列分類模型(classifier)的真實用例:有人用 jev-reviewer 定位論文證據、避免引用幻覺,有人用 is-malicious 掃描 GitHub 倉庫與 PR 的惡意行為,還有人用 decider 4b 替代 Gemma 雙階段流程,把語音 RPG 延遲從 4-8 秒降到 2-3 秒。
llama.cpp 發布 b11352 版本,主要改動是最佳化 qwen4exp 的掩碼(mask)建置(#29824),並將同一改動應用到 GLM5-next。該版本繼續提供 macOS Apple Silicon(arm64)、iOS、Linux、Windows、Android 等平台建置,涵蓋 CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 與 Snapdragon 後端。
愛爾蘭一所公立繼續教育學院(相當於美國的社群學院)拿到資助,建起了一個小型 AI 實驗室,硬體條件還算不錯。發帖人向更有經驗的人徵集教學思路,目標是讓學生獲得使用 ChatGPT 之外的實用技能。帖子本身只提出征集,沒有給出課程方案、招生規模或具體裝置型號等細節。
在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。
Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;
開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。
Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。
匹茲堡大學 HERL 實驗室聯合 ATDev 推進 RAMMP 輔助機器人專案(7 月 27 日發布),用 Meta 開源的 DINO、DINOv3 和 SAM 視覺模型做環境感知,專案獲美國 ARPA-H 最高 4150 萬美元資助。美國約有 550 萬輪椅使用者,每年逾 10 萬起輪椅相關傷害送進急診。團隊把模型最佳化到電池供電的邊緣裝置上執行:降低記憶體佔用、按需使用低精度、控制解析度與批處理,以犧牲少量邊界精度換取即時性與穩定性。
據 wccftech 報導,Micro Center 現在要求購買 RTX 5090 的顧客簽署一份同意遵守禁出口政策的宣告表格,同時該卡價格已漲破 5000 美元。有使用者稱自己此前買過一臺含 5090 的整機,34 天后再想單獨購買時被經理告知已被無限期禁止購買任何 5090。此舉被認為是為了防止轉售和出口,讓更多普通顧客能買到現貨。
微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。
Muse 放出了自建硬體的裝置 SDK:ESP32 Device SDK 與 Linux Device SDK,程式碼以 Apache 2.0 許可託管在 GitHub,領取 SDK Token 後就能用現成 ESP32 開發板或閒置樹莓派接入 Muse,接螢幕、按鈕、麥克風、感測器等外設。
使用者 basnijholt 在 Reddit 發帖並附上部落格文章,論證自託管 AI 並不比用 API 更省錢,但他表示自己照樣會做。他提出兩點:把 200 美元的訂閱(如 Opus 5.5、Astra)與 Qwen 3.8 27B 這類本地模型直接比價並不對等;他也不會把 200 GB 的郵件、聊天記錄和位置歷史交給 API,哪怕對方承諾零資料保留。帖子發出後引發了不少爭議。
Pi pod 是一個圍繞 pi coding agent 建置的自託管沙箱環境,可讓你在自己的伺服器上以隔離沙箱方式執行 pi,並補充了 agent 沙箱、原生客戶端、RBAC 會話共享和介面自動化等能力。自託管版現已提供倉庫可直接部署,託管服務尚未上線,官方計劃 v1 提供需綁卡的 7 天 Standard 試用(10 個活躍小時,之後 20 美元/月)或 50 美元/月的 Pro 方案。
llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 與 get_alloc_size_n 方法,並公開 ggml_backend_buft_alloc_buffer_n、ggml_backend_buft_get_alloc_size_n 兩個 API。預設實現負責多緩衝區分割與張量分配,Meta buffer type 提供自訂實現,按裝置建立子上下文並委託給 simple buffer type;
一篇介紹任天堂 64 官方 Partner-N64 開發套件的文章在 Behind the Code 網站發布,並在 Hacker News 上獲得 16 個點數、1 條評論。文章連結為 behindthecode.ca/partner-n64pc-dev-kit/,HN 討論帖編號 49937146。內容聚焦這套開發硬體的來龍去脈,屬於遊戲主機開發史的技術回顧。
llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。
Ollama v0.35.1 新增對 Cloudflare 開源決策模型 Clef(27B)與 Clef Flash(9B)的支援,通過 /v1/systemone 呼叫。兩者支援多模態,請求可同時傳入圖片與文字 state,所有 questions 共享該狀態並聯合打分,返回如 noul 機率 0.958 的答案。
llama.cpp 發布 b11349,新增 Vulkan 管線編譯問題的日誌輸出(#29794)。該版本提供 macOS/iOS、Linux、Android、Windows、openEuler 建置產物,涵蓋 Ubuntu x64/arm64/s390x CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU。
llama.cpp 最新建置已支援 Decision 模型,新增 /v1/systemone 端點,可在本地高效、私密地做 Jev 風格推理。該端點支援多個開源模型,後續還會增加。
llama.cpp 發布建置版本 b11347(2026-10-02),為 Hexagon 安裝重建後的 HTP skels,並修復 HTP skel 目錄依賴,兩項提交均由 OpenCode 協助完成。
llama.cpp 發布建置 b11346,本次改動是修復 qwen4exp 的測試(PR #29819)。該版本繼續提供 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework 預編譯包,Linux 與 Windows 覆蓋 CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO、SYCL 等後端,另有 Android arm64 與 openEuler 版本。
llama.cpp b11345 為 Hexagon 後端新增 Q2_K 和 Q3_K 量化型別支援,對應 PR #29717,並統一了 src1_row_size 的分配;改動由 Max Krasnyansky(maxk@qti.qualcomm.com)參與提交。
NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;
openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。
Ollama 官方 X 帳號發布了一條僅包含 @bespokelabsai 和 @madiator 兩個提及的帖子,沒有附任何說明文字、連結或產品資訊。該帖發布於 2026 年 9 月 30 日,除此之外原文未提供更多可核實的內容。
Ollama 新增 Nimble、Tev1 4b 和 Tev1 0.8b 三款模型,均可通過 /v1/systemone 介面呼叫。模型已發布在 Ollama 官方庫中,使用者可直接拉取使用。
Ollama 在部落格中宣布現已支援 Jev 風格決策模型,並同步上線決策能力文件與 API 文件。使用者可通過 ollama.com/blog 檢視說明,在 docs.ollama.com/capabilities/decision 瞭解決策能力用法,API 細節見 docs.ollama.com/api/systemone。原文未披露具體模型名稱、效能資料與發布時間以外的限制。
Ollama v0.35.0 新增決策模型支援,通過 /v1/systemone 端點呼叫,基於 TypeSafe 的 Jev API。這類模型不返回文字,而是返回選擇、機率和分數,適合工單分流、模型路由和內容分類;目前可用 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1,用 ollama pull nimble 拉取。
v0.35.1-rc0 為 create 請求新增可疊加的 capabilities 欄位,Modelfile 也可直接寫 CAPABILITY 宣告,且這些宣告會在 GGUF 與 safetensors 的建立、繼承和 Modelfile 匯出中保留。排程 System One 請求前改為要求 decision capability,不再靠匹配 Qwen 的架構/renderer 後設資料。
Photo Scrubber 是一個實驗性工具,能自動識別照片中的人臉並打碼,同時按名稱所述移除後設資料,處理在本地完成。作者拍下抗議者照片後不願分享陌生人可識別的面孔,於是讓 GPT-6 Astra 做了這個工具。它使用 Google 的 MediaPipe C++ 庫,通過 @mediapipe/tasks-vision 編譯成 WebAssembly,人臉檢測採用 BlazeFace 模型。
MLX 發布 v0.32.3,一批修復覆蓋 Metal、CUDA 與 CPU 後端,並新增面向 M5 的非量化 matmul 調優。Metal 側加入 gated delta nets 核心與 fast.cross_entropy 融合核心,降低 SDPA D256/D512 記憶體佔用,同時修復 fp 量化 matmul 在量化維度非 32 倍數時的結果損壞、GGUF 張量維度校驗與零尺寸軸的 scan/sort。
Ollama 0.35 起支援基於 TypeSafe Jev API 的決策模型:通過新的 /v1/systemone 端點,把文字作為 state、配上一組命名問題,本機模型在一次請求裡全部作答,且無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble,以及 Together AI 的實驗性 4B tev1 和 0.8B tev1:0.8b,用 ollama pull 即可下載,可通過 curl 或 TypeSafe 官方 Python SDK 呼叫。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行,無需手動切換。用法與以往一致,例如 ollama pull qwen3.8 後 ollama run qwen3.8。該版本目前為預發布版(v0.40.0-rc0,變更範圍 v0.34.4 到 v0.40.0-rc0),官方稱預發布期間會測試並啟用更多模型,尚未說明具體支援清單與效能差異。
v0.34.4 發布,更新了 llama.cpp、MLX 和 XGrammar,Qwen 3.8 的提示處理在 Apple Silicon 上更快,Gemma 4 會為每張圖片自動選擇最佳解析度以保留更多高畫質細節。思考模型的結構化輸出改為單次推理完成,速度更快也更可靠;同時修復了本地模型庫很大時偶發的 model not found 報錯,以及 macOS 應用在檢測 ChatGPT 或 Codex 是否執行時無回應的問題。