llama.cpp b11510 修復 CUDA PAD 核心 65535 行上限
llama.cpp 發布 b11510,CUDA 後端的 PAD kernel 改為迴圈處理,可支援超過 65535 行或切片的填充,解除此前的行數上限(#30147)。該版本同時更新各平台預編譯產物:macOS Apple Silicon 的 KleidiAI 建置仍標記 DISABLED,openEuler 建置也未啟用;
原標題:b11510
閱讀原文
| 評分 | 45 / 42(平均 43,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置
llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp b11498 發布:修復 CUDA norm 核函式網格超限
llama.cpp 發布 b11498,修復 CUDA 後端 norm 系列核函式在 ne[2]/ne[3] 超過網格維度上限時的問題(PR #28175)。該版本建置產物覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,後端含 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等;
llama.cpp 發布 b11391 版本,CUDA 程式碼小幅調整
llama.cpp 發布 b11391 建置版本,唯一程式碼改動是將 CUDA 後端的 blocks_per_col 變數移到實際使用位置(PR #29939),由 Hugging Face 的 Adrien Gallouët 提交。
llama.cpp b11456:CUDA 緩衝區初始化改用每執行緒流
llama.cpp 發布建置 b11456,其中 ggml-cuda 在緩衝區初始化的 padding memset 中改用每執行緒 stream(#28782),CI 也重新為 ROCm 啟用 test-backend-ops 的 -j 並行測試。該建置覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,含 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等後端;
llama.cpp 發布 b11451,修復 Adreno xmem GEMM 越界讀取
llama.cpp 發布 b11451 建置,主要變更是修復 OpenCL 後端在 Adreno GPU 上 xmem GEMM 的越界讀取(OOB read)問題,對應 PR #30041。