AISpot

搜尋

找到 18 筆

MLX LM releases● 精選4/22 08:43AI 評分65

MLX 發布 v0.31.3,修復批次快取與工具呼叫等大量 bug

MLX 發布 v0.31.3,以大量 bugfix 為主,並新增配合 MLX v0.31.2 的執行緒區域性生成流。修掉了 BatchKVCache、BatchRotatingKVCache 與 ArraysCache 的 extend() 批次維度不匹配,以及 server 並行呼叫、MiniMax M2 並行工具呼叫、Gemma 4 工具解析等問題。

Ollama blog● 精選8/11 01:00AI 評分90

NVIDIA Nemotron 3.5 Lightning 上架 Ollama,支援 MLX 本地執行

NVIDIA 的 30B 開源模型 Nemotron 3.5 Lightning 已在 Ollama 上線,可完全在本地裝置執行,每 token 僅啟用 3B 引數。它支援最長 1M token 上下文,靠推測解碼實現最高 4 倍吞吐。用 ollama launch 即可接入 Claude Code、OpenCode,Apple Silicon 對應 30b-mlx 版本。

MLX LM releases● 精選2/12 18:40AI 評分84

v0.30.7

MLX 發布 v0.30.7。本次新增 GLM5 與 Qwen3.5(無視覺版)支援、LongCat MLA、Mistral 與 LFM2 的工具呼叫解析,修復 Kimi Linear 和 DeepSeek V3.2 的索引器與權重載入,並加快 DeepSeek V3.2 生成。

MLX releases● 精選9/29 01:37AI 評分70

v0.32.3

MLX 發布 v0.32.3,以 bug 修復和 Metal/CUDA 核心最佳化為主。新增 M5 Ultra 非量化 matmul 調優與 Metal gated delta net 核心,並改善 SDPA D256/D512 的 Metal 視訊記憶體佔用。同時修復整數除零崩潰、GGUF 張量維度校驗等問題。

MLX releases● 精選8/25 11:58AI 評分70

v0.32.2

MLX v0.32.2 發布:NAX 裝置新增 head_dim 256 的融合全注意力路徑,量化 MOE matmul 跳過多餘的 simdgroup 計算。同時修復 divmod 浮點商截斷、median 丟棄 NaN、量化切片陣列等問題,並限制 GGUF 後設資料讀取邊界。

MLX LM releases● 精選3/7 03:59AI 評分78

v0.31.0

MLX v0.31.0 已發布。新增 Qwen 3.5 張量並行與 JoyAI LLM Flash 模型支援,並修復 Qwen 3.5 fp32 轉換、MiniMax M2.5 分片 RMS Norm 等問題。快取與視訊記憶體管理有多項改進,server 新增 --prefill-step-size 引數並支援返回 cached_tokens。

Ollama releases● 精選9/29 19:10AI 評分65

v0.35.1-rc0:Modelfile 新增 CAPABILITY 宣告與 capabilities 欄位

v0.35.1-rc0 允許在 Modelfile 中宣告 CAPABILITY,並在 create 請求中增加 capabilities 欄位。這些宣告會在 GGUF、safetensors 的建立、繼承與 Modelfile 匯出中保留。排程 System One 請求前須先判定 capability,不再依賴 Qwen 架構與渲染器後設資料匹配;評分仍限 GGUF,MLX 執行時改動另行處理。

Ollama releases● 精選10/2 19:28AI 評分75

Ollama 支援 Cloudflare 決策模型 Clef 與 Clef Flash

Ollama v0.35.1 通過 /v1/systemone 接入 Cloudflare 開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可同時帶圖片和文字狀態。本次更新還把聯網搜尋上限從每次回答 3 次提升到 10 次,並更新了 llama.cpp 與 MLX 引擎。

Ollama releases● 精選9/24 05:45AI 評分70

v0.34.4 更新:修復本地模型庫報錯,Apple Silicon 推理更快

v0.34.4 已發布。思考模型的結構化輸出改為單次通過,更快更可靠,並修復本地大模型庫間歇性報 model not found 及 macOS 應用檢查 ChatGPT、Codex 時卡死的問題。Qwen 3.8 在 Apple Silicon 上提示處理更快,Gemma 4 會按圖選最佳解析度以保留更多細節。