llama.cpp releases10/3 00:18AI 評分31
llama.cpp 在 32KB 共享記憶體的三星 GPU 上停用大矩陣乘分塊
llama.cpp 合併 PR #28531,在共享記憶體為 32KB 的三星 GPU 上停用 Vulkan 後端的大矩陣乘分塊(large matmul tile),以規避該硬體配置下的問題。該改動由 Claude Opus 輔助完成,並附有建置證明連結。
找到 3 筆;也可以試試 語意搜尋
llama.cpp 合併 PR #28531,在共享記憶體為 32KB 的三星 GPU 上停用 Vulkan 後端的大矩陣乘分塊(large matmul tile),以規避該硬體配置下的問題。該改動由 Claude Opus 輔助完成,並附有建置證明連結。
llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。
llama.cpp 合併 PR #29990,在 MUSA 後端改用向量版 lightning indexer kernel。原因是 MUSA 架構 21 與 22 的靜態共享記憶體上限為 28 KB,而 tile kernel 需要 33 KB,所以 tile kernel 不用於 MUSA;CUDA 與 ROCm 仍執行合併後的原 kernel,沒有變化。