AISpot

llama.cpp b11540 發布:SYCL 加速 MXFP4 MoE 推理

llama.cpp releases版本更新地端推論開源

llama.cpp 建置版本 b11540 發布,核心變更是 SYCL 後端通過算術解碼與權重重排加速 MXFP4 MoE 模型推理(PR #29809)。該版本同時提供 macOS、Linux、Windows、Android 與 openEuler 的預編譯包,覆蓋 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等後端;

原標題:b11540
閱讀原文

評分45 / 42(平均 43,門檻 60)
狀態未入選

原文

sycl : accelerate MXFP4 MoE with arithmetic decoding and weight reordering ( #29809 ) Website: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/54540406 macOS/iOS: macOS Apple Silicon (arm64) macOS Apple Silicon (arm64, KleidiAI enabled) DISABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan) Ubuntu x64 (CUDA 12) - CUDA 12.8 libraries Ubuntu x64 (CUDA 13) - CUDA 13.4 libraries Ubuntu arm64 (CUDA 13) - CUDA 13.4 libraries Ubuntu x64 (ROCm 10.0) Ubuntu x64 (OpenVINO) Ubuntu x64 (SYCL FP32) Ubuntu x64 (SYCL FP16) Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide Android: Android arm64 (CPU) Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide Windows: Windows x64 (CPU) Windows arm64 (CPU) Windows arm64 (OpenCL Adreno) Windows x64 (CUDA 12) - CUDA 12.4 DLLs Windows x64 (CUDA 13) - CUDA 13.4 DLLs Windows arm64 (CUDA 13) - CUDA 13.4 DLLs Windows x64 (Vulkan) Windows arm64 (Vulkan) Windows x64 (OpenVINO) Windows x64 (SYCL) Windows x64 (ROCm 10.0) openEuler: DISABLED openEuler x86 (310p) openEuler x86 (910b, ACL Graph) openEuler aarch64 (310p) openEuler aarch64 (910b, ACL Graph) UI: UI

相關報導

llama.cpp releasesAI 評分42

llama.cpp 為 SYCL 後端加入分組 MoE XMX GEMM

llama.cpp 建置 b11493 為 SYCL 後端新增分組 MoE XMX GEMM 運算元(#29245),面向混合專家模型的矩陣乘加速。該版本同時放出全平台建置產物,覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 組合。

llama.cpp releasesAI 評分37

llama.cpp b11501:SYCL 後端 FWHT 最佳化,macOS KleidiAI 建置停用

llama.cpp 發布 b11501 建置,主要變更是 SYCL 後端的 FWHT 最佳化(PR #29605)。該版本繼續提供 macOS/iOS、Linux、Windows、Android 與 openEuler 的預編譯包,覆蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU。

llama.cpp releasesAI 評分49

llama.cpp 最佳化 CUDA 後端 NVFP4 的 mmq 累加

llama.cpp 發布 b11417 建置,CUDA 後端針對 NVFP4 型別的 mmq 累加做了最佳化,改進 mmq_vec_dot_fp4_fp4_mma 以提升效能,並修正 mma_block_scaled_fp4 迴圈的縮排。該版本建置覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12.8、CUDA 13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;

llama.cpp releasesAI 評分43

llama.cpp b11515:SYCL 加入 Q5_K 重排 MMVQ 與融合 GLU

llama.cpp 發布 b11515,主要變更是 SYCL 後端為 Q5_K 量化補上重排佈局的 MMVQ 核心,並加入融合 GLU(#29375),面向 Intel GPU 的量化推理。建置矩陣照舊覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等後端;

llama.cpp releases● 精選AI 評分69

llama.cpp b11507 支援 MoE 快取跨多 GPU

llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。