llama.cpp 發布 b11370,CUDA 後端將共享專家融合進 MMVQ
llama.cpp 發布建置版本 b11370,CUDA 後端新增將共享專家(shared experts)融合進 MMVQ 的改動(#29184),並修復緩衝區空值檢查、把 stride_col_dst 移入融合引數。
推薦理由:你準備用 Mac Studio 本地跑開源模型,這次 CUDA 側的 MoE 融合最佳化雖不直接作用於 Apple Silicon,但能幫你判斷 llama.cpp 各後端迭代節奏,並留意 macOS 建置中 KleidiAI 被停用對 MLX 之外推理路徑的影響。