llama.cpp b11527:WebGPU 運算元全部改用 2D workgroup 派發
llama.cpp 發布建置 b11527(PR #30219),WebGPU 後端移除 1D workgroup 派發,所有原本使用 1D 派發的運算元(如 rms_norm)統一改為 2D workgroup dispatch。
原標題:b11527
閱讀原文
| 評分 | 45 / 40(平均 42,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp b11523 修復 WebGPU 混合批處理崩潰
llama.cpp 建置 b11523 為 WebGPU 後端補上 GGML_OP_DUP 運算元,修復了混合批處理路徑的崩潰。此前副本須在 CPU 生成、寫入卻排在 WebGPU,導致繫結 CPU 緩衝後崩潰;現在 DUP 與 CPY、CONT 走同一路徑。此版發布中啟用 KleidiAI 的 macOS Apple Silicon 建置被標為 DISABLED。
llama.cpp 為 WebGPU 後端加入 f16 支援
llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…
llama.cpp 發布 b11459:ggml-webgpu 在 WASI 上停用 Dawn 原生特性
llama.cpp 發布建置 b11459,唯一列出的程式碼改動是 ggml-webgpu 在 WASI 上不再啟用 Dawn 原生特性。該建置的預編譯產物覆蓋 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework、Linux、Android、Windows 以及 openEuler。後端包括 CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO 與 SYCL;
llama.cpp 發布 b11402,CUDA 後端改用整塊 FlashAttention 排程
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
llama.cpp 為 WebGPU 後端加入多種量化格式 MMVQ 支援
llama.cpp 合併 PR #29483,為 WebGPU 的 MMVQ 路徑新增 Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K 和 MXFP4 量化支援,併為 Q1_0 引入 K_QUANTS_HANDLING 宏。該改動擴充套件了 WebGPU 後端可加速的量化模型範圍,相關建置覆蓋 macOS、Linux、Windows、Android 及 openEuler 等多個平台。