llama.cpp b11498 發布:修復 CUDA norm 核函式網格超限
llama.cpp 發布 b11498,修復 CUDA 後端 norm 系列核函式在 ne[2]/ne[3] 超過網格維度上限時的問題(PR #28175)。該版本建置產物覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,後端含 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等;
原標題:b11498
閱讀原文
| 評分 | 42 / 42(平均 42,門檻 60) |
| 狀態 | 未入選 |
|---|
原文
CUDA: fix norm family kernels when ne[2]/ne[3] exceed grid dim limits ( #28175 )
Website:
https://llama.app
Attestations:
https://github.com/ggml-org/llama.cpp/attestations/53919465
macOS/iOS:
macOS Apple Silicon (arm64)
macOS Apple Silicon (arm64, KleidiAI enabled) DISABLED
macOS Intel (x64)
iOS XCFramework
Linux:
Ubuntu x64 (CPU)
Ubuntu arm64 (CPU)
Ubuntu s390x (CPU)
Ubuntu x64 (Vulkan)
Ubuntu arm64 (Vulkan)
Ubuntu x64 (CUDA 12) - CUDA 12.8 libraries
Ubuntu x64 (CUDA 13) - CUDA 13.4 libraries
Ubuntu arm64 (CUDA 13) - CUDA 13.4 libraries
Ubuntu x64 (ROCm 10.0)
Ubuntu x64 (OpenVINO)
Ubuntu x64 (SYCL FP32)
Ubuntu x64 (SYCL FP16)
Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Android:
Android arm64 (CPU)
Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Windows:
Windows x64 (CPU)
Windows arm64 (CPU)
Windows arm64 (OpenCL Adreno)
Windows x64 (CUDA 12) - CUDA 12.4 DLLs
Windows x64 (CUDA 13) - CUDA 13.4 DLLs
Windows arm64 (CUDA 13) - CUDA 13.4 DLLs
Windows x64 (Vulkan)
Windows arm64 (Vulkan)
Windows x64 (OpenVINO)
Windows x64 (SYCL)
Windows x64 (ROCm 10.0)
openEuler:
DISABLED
openEuler x86 (310p)
openEuler x86 (910b, ACL Graph)
openEuler aarch64 (310p)
openEuler aarch64 (910b, ACL Graph)
UI:
UI
相關報導
llama.cpp releases10/4 08:56AI 評分37
llama.cpp 發布建置版本 b11390,主要修復了 CUDA 後端在 n_expert 遠大於 n_ubatch 時的 MMQ 記憶體故障(#29941)。
llama.cpp releases10/4 10:12AI 評分16
llama.cpp 發布 b11391 建置版本,唯一程式碼改動是將 CUDA 後端的 blocks_per_col 變數移到實際使用位置(PR #29939),由 Hugging Face 的 Adrien Gallouët 提交。
llama.cpp releases10/4 15:50AI 評分23
llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp releases10/8 12:20AI 評分43
llama.cpp 發布 b11510,CUDA 後端的 PAD kernel 改為迴圈處理,可支援超過 65535 行或切片的填充,解除此前的行數上限(#30147)。該版本同時更新各平台預編譯產物:macOS Apple Silicon 的 KleidiAI 建置仍標記 DISABLED,openEuler 建置也未啟用;
llama.cpp releases10/8 13:27AI 評分38
llama.cpp 發布建置 b11511,主要修復 CUDA 後端 MMQ 的越界讀取問題(#29953)。該版本照常提供 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端建置,覆蓋 Linux、Windows、Android 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU。