MLX 發布 v0.32.0,Windows 新增 JIT 編譯支援
MLX v0.32.0 發布。Windows 新增 JIT 編譯器支援,iOS 預設啟用 Metal 後端,CUDA kernel 加入 JIT 快取。mlx.core.linalg 新增行列式與 sign-log-determinant 函式。
找到 18 筆
MLX v0.32.0 發布。Windows 新增 JIT 編譯器支援,iOS 預設啟用 Metal 後端,CUDA kernel 加入 JIT 快取。mlx.core.linalg 新增行列式與 sign-log-determinant 函式。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。示例命令為 ollama pull qwen3.8 與 ollama run qwen3.8。預發布階段還會繼續測試並啟用更多模型。
MLX 發布 v0.31.2,帶來 Gemma 4 支援(含 tool call parser 與量化逐層載入修復)和 Nemotron-H 支援。此版本還加入不可裁剪快取的系統提示與使用者訊息快取,並重構了批次生成。
MLX 發布 v0.31.3,以大量 bugfix 為主,並新增配合 MLX v0.31.2 的執行緒區域性生成流。修掉了 BatchKVCache、BatchRotatingKVCache 與 ArraysCache 的 extend() 批次維度不匹配,以及 server 並行呼叫、MiniMax M2 並行工具呼叫、Gemma 4 工具解析等問題。
MLX 發布 v0.32.1,以 Metal、CUDA 的修復和效能改進為主,並補齊大量 API 文件。新增統一記憶體零複製匯入 mx.array(host_buffer, copy=False)、Metal gemv_wide 小行數 fp16/bf16 矩陣乘,以及 Metal full attention 的 head dimension 96 支援。
MLX 發布 v0.31.2,現在可用多執行緒執行獨立計算,並新增 CUDA FFT 支援。CUDA 與 Metal 量化 matmul 均獲增強:CUDA 補齊 3/5/6-bit 量化與 GatherQMM,Metal 新增面向小 M 的 split-K。JACCL 成為獨立庫。
MLX LM v0.30.6 發布,支援 Transformers v5,並新增 Kimi-K2.5、LongCat Flash、LongCat Flash Lite、Step 3.5 Flash 等模型。服務端加入分散式推理支援,也可載入自定義模型。同時修復了 DeepSeek V3.2、GLM 4.7 工具呼叫與量化相關問題。
NVIDIA 的 30B 開源模型 Nemotron 3.5 Lightning 已在 Ollama 上線,可完全在本地裝置執行,每 token 僅啟用 3B 引數。它支援最長 1M token 上下文,靠推測解碼實現最高 4 倍吞吐。用 ollama launch 即可接入 Claude Code、OpenCode,Apple Silicon 對應 30b-mlx 版本。
MLX 發布 v0.30.7。本次新增 GLM5 與 Qwen3.5(無視覺版)支援、LongCat MLA、Mistral 與 LFM2 的工具呼叫解析,修復 Kimi Linear 和 DeepSeek V3.2 的索引器與權重載入,並加快 DeepSeek V3.2 生成。
MLX 發布 v0.32.3,以 bug 修復和 Metal/CUDA 核心最佳化為主。新增 M5 Ultra 非量化 matmul 調優與 Metal gated delta net 核心,並改善 SDPA D256/D512 的 Metal 視訊記憶體佔用。同時修復整數除零崩潰、GGUF 張量維度校驗等問題。
MLX v0.32.2 發布:NAX 裝置新增 head_dim 256 的融合全注意力路徑,量化 MOE matmul 跳過多餘的 simdgroup 計算。同時修復 divmod 浮點商截斷、median 丟棄 NaN、量化切片陣列等問題,並限制 GGUF 後設資料讀取邊界。
MLX v0.31.0 已發布。新增 Qwen 3.5 張量並行與 JoyAI LLM Flash 模型支援,並修復 Qwen 3.5 fp32 轉換、MiniMax M2.5 分片 RMS Norm 等問題。快取與視訊記憶體管理有多項改進,server 新增 --prefill-step-size 引數並支援返回 cached_tokens。
Muse Glimmer 是 Meta Superintelligence Labs 的首個開源模型,30B 多模態、Apache 2.0 許可、128K+ 上下文,現已在 Ollama 上線。Apple Silicon 上可通過 Ollama 的 MLX 引擎執行,DFlash 帶來 1.5–1.8 倍提速,並新增影像輸入支援。
v0.35.1-rc0 允許在 Modelfile 中宣告 CAPABILITY,並在 create 請求中增加 capabilities 欄位。這些宣告會在 GGUF、safetensors 的建立、繼承與 Modelfile 匯出中保留。排程 System One 請求前須先判定 capability,不再依賴 Qwen 架構與渲染器後設資料匹配;評分仍限 GGUF,MLX 執行時改動另行處理。
Ollama v0.35.1 通過 /v1/systemone 接入 Cloudflare 開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可同時帶圖片和文字狀態。本次更新還把聯網搜尋上限從每次回答 3 次提升到 10 次,並更新了 llama.cpp 與 MLX 引擎。
Ollama v0.35.0 支援決策模型,經 /v1/systemone 呼叫,返回選擇、機率和分數而非文字。首批可用模型為 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1。支援 choice、noul、score 三種問題型別,適用於工單分類、模型路由和內容分類。
Ollama 0.35 通過新的 /v1/systemone 端點支援基於 TypeSafe Jev API 的決策模型,新增 nimble 9B、tev1 4B、tev1:0.8b 三個模型。本地執行無額外費用、延遲更低,nimble 9B 在 M5 Max 上平均每次決策 91ms。後續更新將帶來 MLX 加速與更多決策模型。
v0.34.4 已發布。思考模型的結構化輸出改為單次通過,更快更可靠,並修復本地大模型庫間歇性報 model not found 及 macOS 應用檢查 ChatGPT、Codex 時卡死的問題。Qwen 3.8 在 Apple Silicon 上提示處理更快,Gemma 4 會按圖選最佳解析度以保留更多細節。