MLX 發布 v0.32.1:修復 Metal 與 CUDA 多項推理缺陷
Apple 的 MLX 框架發布 v0.32.1,集中修復 Metal 與 CUDA 後端的推理、量化與文件問題,並加入多項效能最佳化。Metal 側新增 gemv_wide 加速 fp16/bf16 少行矩陣乘,全注意力支援 head dimension 96,統一記憶體上可用 mx.array(host_buffer, copy=False) 零複製匯入。
你準備用 Mac Studio 跑本地開源模型,這份 changelog 直接列出 MLX 在 Metal 上的運算元與 attention 最佳化,可據此判斷升級後哪些本地推理場景會更快。
原標題:v0.32.1
閱讀原文
| 評分 | 72 / 68(平均 70,門檻 60) |
|---|---|
| 狀態 | 精選(舊聞,已歸檔) |