熱點事件 · 持續更新
llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ
1 則報導1 個報導來源10/2 19:47 更新
先了解這件事
llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。
目前只有一則報導,以上是該報導的摘要。
報導時間線
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
10月2日星期五 · 1 則
-
r/LocalLLaMA top of the day
llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。
本事件熱度走勢
10/3 00:30最高 1.010/3 02:10
為什麼熱
過去 48 小時,有 1 個獨立來源報導,最近 6 小時新增 0 個。熱度 0.8,熱門榜第 21 名。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
事件紀錄
- 最早報導
- 10/2 19:47
- 最近更新
- 10/2 19:47
同一事件的報導集中在這裡,新的進展會繼續補充。