llama.cpp releases10/5 12:46AI 評分36
llama.cpp b11414 修復 Vulkan 後端 flash attention 與 soft_max 複用問…
llama.cpp 發布建置 b11414,本版列出的程式碼改動是 Vulkan 後端修復 prealloc_y 在 flash attention 與 soft_max 之間複用時殘留舊資料的問題(PR #29591),提交標註 Assisted-by: Claude。
找到 2 筆;也可以試試 語意搜尋
llama.cpp 發布建置 b11414,本版列出的程式碼改動是 Vulkan 後端修復 prealloc_y 在 flash attention 與 soft_max 之間複用時殘留舊資料的問題(PR #29591),提交標註 Assisted-by: Claude。
llama.cpp 的 ggml-openvino 後端在 build b11436 修復 CI 測試與 GPU 迴歸。上游 #29622 給輸入 embedding 圖加了混合 token/embd 分支,其中的 DUP 不受支援,導致排程器拆圖、首次單 token decode 在 CPU 與 GPU 失敗,現改為只從 compute 節點建置 OV 模型。