llama.cpp b11515:SYCL 加入 Q5_K 重排 MMVQ 與融合 GLU
llama.cpp 發布 b11515,主要變更是 SYCL 後端為 Q5_K 量化補上重排佈局的 MMVQ 核心,並加入融合 GLU(#29375),面向 Intel GPU 的量化推理。建置矩陣照舊覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等後端;
原標題:b11515
閱讀原文
| 評分 | 45 / 42(平均 43,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp b11460:SYCL 後端新增 IQ3_S 多列 MMVQ
llama.cpp 發布建置 b11460,SYCL 後端新增 IQ3_S 的多列 MMVQ 支援(PR #29500)。該版本繼續提供覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler 的預編譯包,其中 Ubuntu x64 與 Windows x64 包含 SYCL FP32、FP16 建置。
llama.cpp SYCL 為 GLM MLA 預填充接入 MKL,pp8192 提速 2.99 倍
llama.cpp 的 SYCL 後端放行了 GLM-4.7 Flash 的 MLA 形狀走 MKL flash attention,此前該形狀因 K/V 寬度不一致、head dim 上限 512 被排程器拒絕,預填充只能回退到更慢的 TILE kernel。在 Intel Arc Pro B70 上,pp8192 從 432.80 提升到 1292.29 tok/s(2.99 倍,+198.6%),tg256 在噪聲範圍內基本不變(45.67 對 45.65)。
llama.cpp 為 WebGPU 後端加入多種量化格式 MMVQ 支援
llama.cpp 合併 PR #29483,為 WebGPU 的 MMVQ 路徑新增 Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K 和 MXFP4 量化支援,併為 Q1_0 引入 K_QUANTS_HANDLING 宏。該改動擴充套件了 WebGPU 後端可加速的量化模型範圍,相關建置覆蓋 macOS、Linux、Windows、Android 及 openEuler 等多個平台。
llama.cpp 為 SYCL 後端加入分組 MoE XMX GEMM
llama.cpp 建置 b11493 為 SYCL 後端新增分組 MoE XMX GEMM 運算元(#29245),面向混合專家模型的矩陣乘加速。該版本同時放出全平台建置產物,覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 組合。
llama.cpp 發布 b11370,CUDA 後端融合共享專家至 MMVQ
llama.cpp 發布版本 b11370,主要變更是 CUDA 後端將共享專家(shared experts)融合進 MMVQ 運算元,並檢查緩衝區是否為空、把 stride_col_dst 移入融合引數。該版本同時提供 macOS、Linux、Windows、Android 等多平台建置,其中 macOS Apple Silicon 的 KleidiAI 版本被停用,openEuler 建置也被停用。