llama.cpp b11466 修復 WebGPU flash_attn 的 KV 重疊檢查
llama.cpp 發布 b11466,唯一程式碼改動是修復 ggml-webgpu 後端 flash_attn 對 KV 重疊情形的 supports_op 檢查(#28205)。該版本同步更新各平台預編譯包,涵蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,後端包括 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU;
原標題:b11466
閱讀原文
| 評分 | 45 / 40(平均 42,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 發布 b11424,修復 Vulkan Flash Attention 共享記憶體越界寫
llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。
llama.cpp b11414 修復 Vulkan 後端 flash attention 與 soft_max 複用問…
llama.cpp 發布建置 b11414,本版列出的程式碼改動是 Vulkan 後端修復 prealloc_y 在 flash attention 與 soft_max 之間複用時殘留舊資料的問題(PR #29591),提交標註 Assisted-by: Claude。
llama.cpp 發布 b11402,CUDA 後端改用整塊 FlashAttention 排程
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
llama.cpp 為 Metal 新增 F16 KV 張量 API flash attention 核心
llama.cpp 合併 PR #29570,在 Metal 後端為 F16 KV 快取加入基於張量 API 的 flash attention 核心。該核心覆蓋 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等配置,並支援 attention sinks、ALiBi 與 logit softcap。改動隨 b11362 建置發布,覆蓋 macOS Apple Silicon、iOS 及 Linux、Windows、Android 等多平台建置。
llama.cpp 修復 SYCL 混用不同型號 GPU 的 FA 問題
llama.cpp 合併 PR #29071,修復 SYCL 後端在 Flash Attention(FA)中混用不同型號 GPU 時出現的問題。改動位於 ggml/src/ggml-sycl/ggml-sycl.cpp,提交由 Georgi Gerganov 共同署名。該修復包含在版本 b11464 中,此版本同時提供 Ubuntu x64(SYCL FP32、FP16)與 Windows x64(SYCL)等建置。