llama.cpp 為 SYCL 後端加入分組 MoE XMX GEMM
llama.cpp 建置 b11493 為 SYCL 後端新增分組 MoE XMX GEMM 運算元(#29245),面向混合專家模型的矩陣乘加速。該版本同時放出全平台建置產物,覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 組合。
原標題:b11493
閱讀原文
| 評分 | 45 / 40(平均 42,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp SYCL 為 GLM MLA 預填充接入 MKL,pp8192 提速 2.99 倍
llama.cpp 的 SYCL 後端放行了 GLM-4.7 Flash 的 MLA 形狀走 MKL flash attention,此前該形狀因 K/V 寬度不一致、head dim 上限 512 被排程器拒絕,預填充只能回退到更慢的 TILE kernel。在 Intel Arc Pro B70 上,pp8192 從 432.80 提升到 1292.29 tok/s(2.99 倍,+198.6%),tg256 在噪聲範圍內基本不變(45.67 對 45.65)。
llama.cpp b11460:SYCL 後端新增 IQ3_S 多列 MMVQ
llama.cpp 發布建置 b11460,SYCL 後端新增 IQ3_S 的多列 MMVQ 支援(PR #29500)。該版本繼續提供覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler 的預編譯包,其中 Ubuntu x64 與 Windows x64 包含 SYCL FP32、FP16 建置。
llama.cpp b11507 支援 MoE 快取跨多 GPU
llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。
llama.cpp b11501:SYCL 後端 FWHT 最佳化,macOS KleidiAI 建置停用
llama.cpp 發布 b11501 建置,主要變更是 SYCL 後端的 FWHT 最佳化(PR #29605)。該版本繼續提供 macOS/iOS、Linux、Windows、Android 與 openEuler 的預編譯包,覆蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU。
llama.cpp 發布 b11491:清理 SYCL 標頭檔案重複的 block-size 定義
llama.cpp 發布 b11491,主要變更是移除 SYCL 運算元標頭檔案中重複的 block-size 定義,這些數值與 ggml/src/ggml-sycl/presets.hpp 裡的定義完全重複(PR #29507),屬清理性改動。