transformers 現可直接執行 GGUF 模型
ggml 作者 ggerganov 宣布,transformers 現在可以直接執行 GGUF 模型。這項工作把 ggml 的 Metal 核心引入 transformers 生態,提升了相容性與效能。更多細節見其後續說明。
ggml 作者 ggerganov 宣布,transformers 現在可以直接執行 GGUF 模型。這項工作把 ggml 的 Metal 核心引入 transformers 生態,提升了相容性與效能。更多細節見其後續說明。
LM Studio 宣布其 Splash 引擎已開源,程式碼託管在 GitHub 的 incoai/splash 倉庫。原文只給出這一條資訊和倉庫連結,沒有說明 Splash 的具體功能、支援的模型格式、效能資料或與 MLX、llama.cpp 的關係。想了解它能否用於本地跑開源模型,需要直接檢視該倉庫。
LM Studio 新增 Splash 引擎,可在 Settings > Runtime > Experimental backends 中開啟。官方建議使用 macOS 26.4 及以上的 M3 或更新 Mac,記憶體至少 36GB,並可在模型搜尋中查詢 incoai 下載受支援模型。
LM Studio 與 inco_ai 合作,在發布當天(day 0)就把 Splash 推理引擎接入 LM Studio。官方給出的資料是:在 M5 Max 上執行 Qwen3.8-27B,速度最高可達 144 tok/sec。想試的話可通過 LM Studio 官方部落格的連結直接跑起來。
Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。
LM Studio 發布部落格,介紹 Bionic 中的 Introspection 與 Session References 兩項新功能。官方未在推文中給出具體引數、價格或上線時間,僅提供部落格連結供進一步瞭解。對本地跑模型的使用者來說,這屬於 LM Studio 執行時能力的一次更新。
Apple 已經提供一個名為 MLX 的工具,用於在 Apple 硬體上高效執行 AI 模型。該資訊由 @awnihannun 在 2026 年 9 月 17 日發布,正文僅確認 MLX 的存在與用途,未提及具體效能資料、支援模型或使用限制。
DeepSeek 表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署選項。官方同時放出模型與論文連結,並稱可承接 2000 塊 GPU 加儲存叢集的大規模部署需求。
DeepSeek 發布 V4.1-Flash,其 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
Mistral 與 Cloudera 於 2026 年 9 月 10 日宣布合作,把 Mistral 模型整合進 Cloudera 混合資料平台,企業可在私有云、公有云、本地乃至完全氣隙環境中執行推理。企業還能在受控環境裡用自有專有資料訓練定製模型,並以開放權重方式擁有模型與資料。Cloudera 稱其平台上執行著客戶自管的 30 EB 資料,合作面向金融、製造、電信等受監管行業,核心是讓資料、智慧、算力與運營留在客戶手中。
NVIDIA 已收購 Hugging Face,llama.cpp 作者 ggerganov 確認這一訊息。NVIDIA 工程師已為 llama.cpp 貢獻程式碼、協作社群並提供開發測試硬體超過一年。ggerganov 表示 llama.cpp/ggml 將繼續堅持硬體無關原則,所有後端的開發與支援仍由社群驅動,向所有人開放。
Awni Hannun 稱 Qwen 27B dense 模型在 M5 Max 上輸出速度達 105 tok/s,並形容這一表現相當驚人。他同時表示這是在“一塊磚一塊磚地”突破記憶體牆。原文未說明所用推理框架、量化精度與上下文長度。
該開源張量框架的 v0.32.2 版本發布,內容以 bug 修復和核心效能最佳化為主,未附基準數字。修復包括量化切片陣列、float divmod 商被截斷、median 丟棄 NaN、einsum 丟失尾部空下標、轉 bool 時丟失 subnormal 浮點值等。
Ollama 現在可作為第三方閘道器接入 Claude Desktop,開發者在 Ollama 中開啟 Claude 開關即可自動完成配置。連線後可選任意 Ollama 模型,包括本地執行的開放模型與 Ollama 雲端模型,也能隨時切回 Anthropic 模型;在 Ollama 裡關閉 Claude 即恢復原有設定。
Apple 的 MLX 框架發布 v0.32.1,集中修復 Metal 與 CUDA 後端的推理、量化與文件問題,並加入多項效能最佳化。Metal 側新增 gemv_wide 加速 fp16/bf16 少行矩陣乘,全注意力支援 head dimension 96,統一記憶體上可用 mx.array(host_buffer, copy=False) 零複製匯入。
NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。
Muse Glimmer 現已在 Ollama 上線,這是 Meta Superintelligence Labs 發布的首個開放模型。它是 30B 多模態模型,專為本地執行的 agent 工作負載設計,上下文 128K 以上,採用 Apache 2.0 許可,可直接驅動 Claude Code、Codex、Pi、OpenClaw 等。
Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。
Apple 的 MLX 發布 v0.32.0,包含大量修復與改進。iOS 上 Metal 後端預設啟用;CUDA kernel 新增 JIT 編譯快取,qmm_naive 也改為 JIT 編譯;mlx.core.linalg 新增 determinant 與 sign-log-determinant,mx.asarray 增加 copy 關鍵字,finfo 增加 bits 與 smallest_normal。
MLX 在 2026-04-22 發布補丁版 v0.31.3,以大量 bug 修復為主,並新增執行緒本地生成流(thread local generation stream),配合 MLX v0.31.2。修復覆蓋 BatchKVCache、BatchRotatingKVCache 與 ArraysCache 的 batch 維度不匹配,以及服務端並行工具呼叫、MiniMax M2 並行工具呼叫和 Mistral 空 tool_call_end 導致的工具呼叫中斷。
MLX 發布 v0.31.2,把 CUDA 後端的量化矩陣乘擴充套件到了 3/5/6-bit、int4 與浮點量化(qmm_naive、qmm_sm80),並新增 GatherQMM 和 CUDA FFT。框架現在支援多執行緒執行獨立計算:CommandEncoder、ThreadLocalStream 改為執行緒本地,Scheduler::enqueue 執行緒安全,JACCL 拆分為獨立庫。
MLX 生態的 mlx_lm 發布 v0.31.2(上一版為 v0.31.0),重點是新增 Gemma 4 支援,包括工具呼叫解析器、多 token 的 think 與工具起止標記,並修復其量化逐層投影載入。此次還重構了 BatchGenerator、為非裁剪型快取快取系統提示與使用者訊息,批處理生成器恢復 max-kv-size 引數,伺服器新增 --allowed-origins 選項,並加入 Nemotron super 支援。
v0.31.0 發布,從 v0.30.7 升級而來,新增 JoyAI LLM Flash 模型支援,併為 Qwen 3.5 加入張量並行;同時允許共享模型,修復 CacheList 儲存與載入、MLA 模型混合量化判斷、Qwen3.5 轉 fp32 與 sanitize、MiniMax M2.5 分片 RMS norm。
2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。
MLX LM 發布 v0.30.6,新增 Kimi-K2.5、LongCat Flash/Lite 和 Step 3.5 Flash 等模型支援,並引入 Transformers v5。服務端加入分散式推理,支援 chat_template_kwargs、top_logprobs 與載入自訂模型,同時新增 CLI。