llama.cpp 新 PR:CUDA 把共享專家融合進 MMVQ
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
你在 Mac Studio 上跑本地模型走的是 Metal,這條 CUDA 專屬最佳化暫時用不上,但可藉此關注 llama.cpp 對 MoE 推理的持續改動。
原標題:CUDA: fuse shared experts into MMVQ by am17an · Pull Request #29184 · ggml-org/llama.cpp
閱讀原文
| 評分 | 64 / 55(平均 59,門檻 76) |
|---|---|
| 狀態 | 未入選 |