搜尋
找到 3 筆;也可以試試 語意搜尋
llama.cpp releasesAI 評分42
llama.cpp 發布 b11498,修復 CUDA 後端 norm 系列核函式在 ne[2]/ne[3] 超過網格維度上限時的問題(PR #28175)。該版本建置產物覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,後端含 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等;
llama.cpp releasesAI 評分49
llama.cpp 發布 b11417 建置,CUDA 後端針對 NVFP4 型別的 mmq 累加做了最佳化,改進 mmq_vec_dot_fp4_fp4_mma 以提升效能,並修正 mma_block_scaled_fp4 迴圈的縮排。該版本建置覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12.8、CUDA 13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp releasesAI 評分43
llama.cpp 建置 b11533 修復了 Adreno A6x GPU 上的 OpenCL 核心編譯崩潰,並把 Adreno 623 加入 A6X 檢測列表。具體做法是在 A6X 上跳過 kernel_cpy_f32_f32_pack——A623 的編譯器後端(E031.50.31.01)無法處理引數過多的核心;GEMV 核心裡的 get_local_size 也加了常量摺疊變通方案。