MLX LM releases● 精選3/7 03:59AI 評分78
v0.31.0 發布:新增 JoyAI LLM Flash 與 Qwen 3.5 張量並行
v0.31.0 發布,從 v0.30.7 升級而來,新增 JoyAI LLM Flash 模型支援,併為 Qwen 3.5 加入張量並行;同時允許共享模型,修復 CacheList 儲存與載入、MLA 模型混合量化判斷、Qwen3.5 轉 fp32 與 sanitize、MiniMax M2.5 分片 RMS norm。
找到 2 筆
v0.31.0 發布,從 v0.30.7 升級而來,新增 JoyAI LLM Flash 模型支援,併為 Qwen 3.5 加入張量並行;同時允許共享模型,修復 CacheList 儲存與載入、MLA 模型混合量化判斷、Qwen3.5 轉 fp32 與 sanitize、MiniMax M2.5 分片 RMS norm。
Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。