AISpot

llama.cpp 新 PR:CUDA 把共享專家融合進 MMVQ

r/LocalLLaMA top of the day10/2 19:47社群讨论地端推論開源

llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。

你在 Mac Studio 上跑本地模型走的是 Metal,這條 CUDA 專屬最佳化暫時用不上,但可藉此關注 llama.cpp 對 MoE 推理的持續改動。

原標題:CUDA: fuse shared experts into MMVQ by am17an · Pull Request #29184 · ggml-org/llama.cpp
閱讀原文

評分64 / 55(平均 59,門檻 76)
狀態未入選