v0.31.0
MLX v0.31.0 已發布。新增 Qwen 3.5 張量並行與 JoyAI LLM Flash 模型支援,並修復 Qwen 3.5 fp32 轉換、MiniMax M2.5 分片 RMS Norm 等問題。快取與視訊記憶體管理有多項改進,server 新增 --prefill-step-size 引數並支援返回 cached_tokens。
找到 11 筆
MLX v0.31.0 已發布。新增 Qwen 3.5 張量並行與 JoyAI LLM Flash 模型支援,並修復 Qwen 3.5 fp32 轉換、MiniMax M2.5 分片 RMS Norm 等問題。快取與視訊記憶體管理有多項改進,server 新增 --prefill-step-size 引數並支援返回 cached_tokens。
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
llama.cpp b11346 修復 qwen4exp 測試,並提供多平台構建。
llama.cpp 發布 b11352,主要改動是最佳化 Qwen4 的 mask 構建(#29824),並把同一改動應用到 GLM5-next。構建產物覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台。其中 macOS Apple Silicon 的 KleidiAI enabled 版本標記為 DISABLED。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。示例命令為 ollama pull qwen3.8 與 ollama run qwen3.8。預發布階段還會繼續測試並啟用更多模型。
Meta 推出 30B 開源模型 Muse Glimmer,Apache 2.0 許可,今日起可在 LM Studio Bionic 下載並本地執行,支援工具呼叫和影像輸入。在該平台 BionicBench v0.1 評測中,它完成 83.3% 的任務,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。
v0.35.1-rc0 允許在 Modelfile 中宣告 CAPABILITY,並在 create 請求中增加 capabilities 欄位。這些宣告會在 GGUF、safetensors 的建立、繼承與 Modelfile 匯出中保留。排程 System One 請求前須先判定 capability,不再依賴 Qwen 架構與渲染器後設資料匹配;評分仍限 GGUF,MLX 執行時改動另行處理。
Ollama 於 8 月 31 日把 Pro、Max、Team 計劃改為按 token 透明計費。Pro 每月 20 美元含 60 美元用量,Max 100 美元含 300 美元,Team 500 美元含 1000 美元共享用量、不限使用者。新套餐無服務費與 5 小時或每週限額,支援 Claude Code、Codex,零資料保留。
博主 basnijholt 發文論證自託管 AI 不能省錢,但他依然堅持自託管。他明確表示不會把 200 GB 郵件、訊息和位置歷史交給 API,無論是否零資料保留。他還指出,拿 200 美元訂閱與 Qwen 3.8 27B 相比並不對等。
NVIDIA DGX Spark 64GB 統一記憶體版 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,單機支援最高 1000 億引數模型本地執行。兩臺經 ConnectX-7 組叢集后記憶體擴至 128GB、可跑 2000 億引數,官方 Qwen 3.8 27B 測試效能最高 1.7 倍。
v0.34.4 已發布。思考模型的結構化輸出改為單次通過,更快更可靠,並修復本地大模型庫間歇性報 model not found 及 macOS 應用檢查 ChatGPT、Codex 時卡死的問題。Qwen 3.8 在 Apple Silicon 上提示處理更快,Gemma 4 會按圖選最佳解析度以保留更多細節。