AISpot

搜尋

找到 2 筆;也可以試試 語意搜尋

llama.cpp releases● 精選10/7 14:45AI 評分78

llama.cpp 合併 GLM5-Next MTP 支援,可作 draft 模型

llama.cpp 合併 PR #29928,為 GLM5-Next 加入多 token 預測(MTP)的 NextN 計算圖,使其能作為投機解碼的 draft 模型使用。改動包括支援只含 NextN 層或只含主幹張量的拆分 GGUF 檔案載入,並把 MTP 圖按輸出行裁剪,無輸出行的 4-token catch-up 核心耗時從 6.9 ms 降到 2.9 ms,貪心輸出雜湊與 draft 接受率不變。