llama.cpp 新 PR:CUDA 把共享專家融合進 MMVQ
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
找到 7 筆
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
MLX 發布 v0.31.2,現在可用多執行緒執行獨立計算,並新增 CUDA FFT 支援。CUDA 與 Metal 量化 matmul 均獲增強:CUDA 補齊 3/5/6-bit 量化與 GatherQMM,Metal 新增面向小 M 的 split-K。JACCL 成為獨立庫。
MLX 發布 v0.32.1,以 Metal、CUDA 的修復和效能改進為主,並補齊大量 API 文件。新增統一記憶體零複製匯入 mx.array(host_buffer, copy=False)、Metal gemv_wide 小行數 fp16/bf16 矩陣乘,以及 Metal full attention 的 head dimension 96 支援。
MLX v0.32.0 發布。Windows 新增 JIT 編譯器支援,iOS 預設啟用 Metal 後端,CUDA kernel 加入 JIT 快取。mlx.core.linalg 新增行列式與 sign-log-determinant 函式。
MLX 發布 v0.32.3,以 bug 修復和 Metal/CUDA 核心最佳化為主。新增 M5 Ultra 非量化 matmul 調優與 Metal gated delta net 核心,並改善 SDPA D256/D512 的 Metal 視訊記憶體佔用。同時修復整數除零崩潰、GGUF 張量維度校驗等問題。
MLX v0.32.2 發布:NAX 裝置新增 head_dim 256 的融合全注意力路徑,量化 MOE matmul 跳過多餘的 simdgroup 計算。同時修復 divmod 浮點商截斷、median 丟棄 NaN、量化切片陣列等問題,並限制 GGUF 後設資料讀取邊界。
NVIDIA 稱 AI 工廠以高產出、長壽命、通用性最大化投資回報,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 逾 30 倍,每百萬 token 成本低至 1/45。