AISpot
熱點事件 · 持續更新

llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ

1 則報導1 個報導來源10/2 19:47 更新

先了解這件事

llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。

目前只有一則報導,以上是該報導的摘要。

報導時間線

沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。

10月2日星期五 · 1 則

  1. r/LocalLLaMA top of the day

    llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ

    llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。

本事件熱度走勢

10/3 00:30最高 1.010/3 02:10

為什麼熱

過去 48 小時,有 1 個獨立來源報導,最近 6 小時新增 0 個。熱度 0.8,熱門榜第 21 名。

熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。

事件紀錄

最早報導
10/2 19:47
最近更新
10/2 19:47

同一事件的報導集中在這裡,新的進展會繼續補充。