llama.cpp b11540 發布:SYCL 加速 MXFP4 MoE 推理
llama.cpp 建置版本 b11540 發布,核心變更是 SYCL 後端通過算術解碼與權重重排加速 MXFP4 MoE 模型推理(PR #29809)。該版本同時提供 macOS、Linux、Windows、Android 與 openEuler 的預編譯包,覆蓋 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等後端;
原標題:b11540
閱讀原文
| 評分 | 45 / 42(平均 43,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 為 SYCL 後端加入分組 MoE XMX GEMM
llama.cpp 建置 b11493 為 SYCL 後端新增分組 MoE XMX GEMM 運算元(#29245),面向混合專家模型的矩陣乘加速。該版本同時放出全平台建置產物,覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 組合。
llama.cpp b11501:SYCL 後端 FWHT 最佳化,macOS KleidiAI 建置停用
llama.cpp 發布 b11501 建置,主要變更是 SYCL 後端的 FWHT 最佳化(PR #29605)。該版本繼續提供 macOS/iOS、Linux、Windows、Android 與 openEuler 的預編譯包,覆蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU。
llama.cpp 最佳化 CUDA 後端 NVFP4 的 mmq 累加
llama.cpp 發布 b11417 建置,CUDA 後端針對 NVFP4 型別的 mmq 累加做了最佳化,改進 mmq_vec_dot_fp4_fp4_mma 以提升效能,並修正 mma_block_scaled_fp4 迴圈的縮排。該版本建置覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12.8、CUDA 13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp b11515:SYCL 加入 Q5_K 重排 MMVQ 與融合 GLU
llama.cpp 發布 b11515,主要變更是 SYCL 後端為 Q5_K 量化補上重排佈局的 MMVQ 核心,並加入融合 GLU(#29375),面向 Intel GPU 的量化推理。建置矩陣照舊覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等後端;
llama.cpp b11507 支援 MoE 快取跨多 GPU
llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。