llama.cpp 發布 b11462,含 SYCL fattn 緩衝區清理
llama.cpp 發布 b11462 建置,本次合併的主要改動是 SYCL 後端的 fattn_kv_buffers 清理(#27689)。該版本繼續提供 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL,以及驍龍平台的 CPU、Adreno GPU 與 Hexagon NPU。
原標題:b11462
閱讀原文
| 評分 | 35 / 35(平均 35,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 發布 b11461,修復 AMD 核顯 Vulkan 檢查點讀取慢
llama.cpp 發布 b11461,主要改動是修復 AMD 整合顯示卡在 Vulkan 後端下檢查點(checkpoint)讀取過慢的問題,對應 PR #30049。該版本同時更新了 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 後端。
llama.cpp 發布 b11425:CUDA alloc_deps 檢查改為與 batch 無關
llama.cpp 發布 b11425 建置,主要變更是把 CUDA 後端的 alloc_deps 檢查改為與 batch 無關(PR #29986,修復 #29980)。該版本同時更新各平台預編譯產物,覆蓋 macOS Apple Silicon 與 Intel、iOS XCFramework、Android arm64,以及 Windows 和 Ubuntu 上的 CUDA 12、CUDA 13、Vulkan、ROCm 10.0、SYCL、OpenVINO 等後端。
llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤
llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。
llama.cpp 修復 SYCL 混用不同型號 GPU 的 FA 問題
llama.cpp 合併 PR #29071,修復 SYCL 後端在 Flash Attention(FA)中混用不同型號 GPU 時出現的問題。改動位於 ggml/src/ggml-sycl/ggml-sycl.cpp,提交由 Georgi Gerganov 共同署名。該修復包含在版本 b11464 中,此版本同時提供 Ubuntu x64(SYCL FP32、FP16)與 Windows x64(SYCL)等建置。
llama.cpp 發布 b11424,修復 Vulkan Flash Attention 共享記憶體越界寫
llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。