MLX v0.31.2 發布,CUDA 量化矩陣乘與多執行緒支援增強
MLX 發布 v0.31.2,把 CUDA 後端的量化矩陣乘擴充套件到了 3/5/6-bit、int4 與浮點量化(qmm_naive、qmm_sm80),並新增 GatherQMM 和 CUDA FFT。框架現在支援多執行緒執行獨立計算:CommandEncoder、ThreadLocalStream 改為執行緒本地,Scheduler::enqueue 執行緒安全,JACCL 拆分為獨立庫。
你準備用 Mac Studio 本地跑開源模型,Metal 的小 M split-K 量化矩陣乘與多執行緒執行直接決定本地推理吞吐和併發能力,這版更新正是這些場景的效能與穩定性修復。
原標題:v0.31.2
閱讀原文
| 評分 | 70 / 78(平均 74,門檻 60) |
|---|---|
| 狀態 | 精選(舊聞,已歸檔) |