b11436: ggml-openvino: fix CI tests; fix GPU regressions. (#30037)
llama.cpp 的 ggml-openvino 後端在 build b11436 修復 CI 測試與 GPU 迴歸。上游 #29622 給輸入 embedding 圖加了混合 token/embd 分支,其中的 DUP 不受支援,導致排程器拆圖、首次單 token decode 在 CPU 與 GPU 失敗,現改為只從 compute 節點建置 OV 模型。
llama.cpp 於 2026 年 10 月 5 日合併 PR #29622(build b11400),支援在單一批次中同時傳入嵌入向量(embd)與原始 token;次日發布的 build b11436 修復了該改動給 ggml-openvino 後端帶來的迴歸。據 llama.cpp releases 說明,#29622 新增 llm_arch_supports_mixed_batch 為 false 時的檢查分支,改動還包括固定圖拓撲、為混合場景設定專用輸入、移除 set_tensor_backend、把 is_embd 改為 type、統一 m-rope 位置處理。該 PR 經 ggml_build_forward_select() 為每個輸入 embedding 圖加上混合 token/embd 分支,這些節點未被標記為 compute 卻仍被後端翻譯,其中 DUP 不受支援,導致排程器拆圖並以固定 token 數傳遞嵌入,首次單 token decode 隨之在 CPU 與 GPU 上失敗(test-thread-safety);b11436 改為只從 compute 節點建置 OpenVINO 模型,並把同型別連續的 DUP 像 CONT 一樣翻譯,使圖留在單一後端。同一 PR 還把 gemma3、gemma3n、gemma4 的逐 token embedding scale 移入新的 [1, n_tokens] 輸入,OpenVINO 後端為其設定動態 token 維度,並在靜態(NPU)路徑上按 chunk 補齊。
AI 根據 2 則報導生成 · 10/6 08:31 更新
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
llama.cpp 的 ggml-openvino 後端在 build b11436 修復 CI 測試與 GPU 迴歸。上游 #29622 給輸入 embedding 圖加了混合 token/embd 分支,其中的 DUP 不受支援,導致排程器拆圖、首次單 token decode 在 CPU 與 GPU 失敗,現改為只從 compute 節點建置 OV 模型。
llama.cpp 合併 PR #29622,在單一批次中同時支援嵌入向量(embd)和原始 token,並新增 llm_arch_supports_mixed_batch 為 false 時的檢查分支。改動包括固定圖拓撲、為混合場景設定專用輸入、移除 set_tensor_backend、將 is_embd 改為 type,並統一 m-rope 位置處理。
過去 48 小時,有 1 個獨立來源報導,最近 6 小時新增 0 個。熱度 0.4,熱門榜第 92 名。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
同一事件的報導集中在這裡,新的進展會繼續補充。