AISpot

搜尋

找到 3 筆;也可以試試 語意搜尋

llama.cpp releasesAI 評分49

llama.cpp 最佳化 CUDA 後端 NVFP4 的 mmq 累加

llama.cpp 發布 b11417 建置,CUDA 後端針對 NVFP4 型別的 mmq 累加做了最佳化,改進 mmq_vec_dot_fp4_fp4_mma 以提升效能,並修正 mma_block_scaled_fp4 迴圈的縮排。該版本建置覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12.8、CUDA 13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;

llama.cpp releasesAI 評分43

llama.cpp 修復 Adreno A6x 的 OpenCL 核心編譯崩潰並支援 623

llama.cpp 建置 b11533 修復了 Adreno A6x GPU 上的 OpenCL 核心編譯崩潰,並把 Adreno 623 加入 A6X 檢測列表。具體做法是在 A6X 上跳過 kernel_cpy_f32_f32_pack——A623 的編譯器後端(E031.50.31.01)無法處理引數過多的核心;GEMV 核心裡的 get_local_size 也加了常量摺疊變通方案。