AISpot
熱點事件 · 持續更新

llama.cpp 批次內混合 embd 與原始 token,並修復 OpenVINO 迴歸

2 則報導1 個報導來源10/6 07:57 更新

先了解這件事AI 綜述

llama.cpp 於 2026 年 10 月 5 日合併 PR #29622(build b11400),支援在單一批次中同時傳入嵌入向量(embd)與原始 token;次日發布的 build b11436 修復了該改動給 ggml-openvino 後端帶來的迴歸。據 llama.cpp releases 說明,#29622 新增 llm_arch_supports_mixed_batch 為 false 時的檢查分支,改動還包括固定圖拓撲、為混合場景設定專用輸入、移除 set_tensor_backend、把 is_embd 改為 type、統一 m-rope 位置處理。該 PR 經 ggml_build_forward_select() 為每個輸入 embedding 圖加上混合 token/embd 分支,這些節點未被標記為 compute 卻仍被後端翻譯,其中 DUP 不受支援,導致排程器拆圖並以固定 token 數傳遞嵌入,首次單 token decode 隨之在 CPU 與 GPU 上失敗(test-thread-safety);b11436 改為只從 compute 節點建置 OpenVINO 模型,並把同型別連續的 DUP 像 CONT 一樣翻譯,使圖留在單一後端。同一 PR 還把 gemma3、gemma3n、gemma4 的逐 token embedding scale 移入新的 [1, n_tokens] 輸入,OpenVINO 後端為其設定動態 token 維度,並在靜態(NPU)路徑上按 chunk 補齊。

AI 根據 2 則報導生成 · 10/6 08:31 更新

報導時間線

沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。

沒有符合條件的報導。

本事件熱度走勢

10/5 02:10最高 1.010/6 10:30

為什麼熱

過去 48 小時,有 1 個獨立來源報導,最近 6 小時新增 0 個。熱度 0.4,熱門榜第 92 名。

熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。

事件紀錄

最早報導
10/5 01:06
最近更新
10/6 07:57

同一事件的報導集中在這裡,新的進展會繼續補充。