llama.cpp b11511 修復 CUDA MMQ 越界讀取
llama.cpp 發布建置 b11511,主要修復 CUDA 後端 MMQ 的越界讀取問題(#29953)。該版本照常提供 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端建置,覆蓋 Linux、Windows、Android 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU。
原標題:b11511
閱讀原文
| 評分 | 42 / 35(平均 38,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 發布 b11390,修復 CUDA MMQ 記憶體錯誤
llama.cpp 發布建置版本 b11390,主要修復了 CUDA 後端在 n_expert 遠大於 n_ubatch 時的 MMQ 記憶體故障(#29941)。
llama.cpp 發布 b11451,修復 Adreno xmem GEMM 越界讀取
llama.cpp 發布 b11451 建置,主要變更是修復 OpenCL 後端在 Adreno GPU 上 xmem GEMM 的越界讀取(OOB read)問題,對應 PR #30041。
llama.cpp 發布 b11461,修復 AMD 核顯 Vulkan 檢查點讀取慢
llama.cpp 發布 b11461,主要改動是修復 AMD 整合顯示卡在 Vulkan 後端下檢查點(checkpoint)讀取過慢的問題,對應 PR #30049。該版本同時更新了 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 後端。
llama.cpp 發布 b11391 版本,CUDA 程式碼小幅調整
llama.cpp 發布 b11391 建置版本,唯一程式碼改動是將 CUDA 後端的 blocks_per_col 變數移到實際使用位置(PR #29939),由 Hugging Face 的 Adrien Gallouët 提交。
llama.cpp 最佳化 CUDA 後端 NVFP4 的 mmq 累加
llama.cpp 發布 b11417 建置,CUDA 後端針對 NVFP4 型別的 mmq 累加做了最佳化,改進 mmq_vec_dot_fp4_fp4_mma 以提升效能,並修正 mma_block_scaled_fp4 迴圈的縮排。該版本建置覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12.8、CUDA 13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;