AISpot

搜尋

找到 27 筆

llama.cpp releases10/7 12:11AI 評分42

llama.cpp 修復 SYCL 混用不同型號 GPU 的 FA 問題

llama.cpp 合併 PR #29071,修復 SYCL 後端在 Flash Attention(FA)中混用不同型號 GPU 時出現的問題。改動位於 ggml/src/ggml-sycl/ggml-sycl.cpp,提交由 Georgi Gerganov 共同署名。該修復包含在版本 b11464 中,此版本同時提供 Ubuntu x64(SYCL FP32、FP16)與 Windows x64(SYCL)等建置。

llama.cpp releases● 精選10/7 11:43AI 評分68

llama.cpp SYCL 為 GLM MLA 預填充接入 MKL,pp8192 提速 2.99 倍

llama.cpp 的 SYCL 後端放行了 GLM-4.7 Flash 的 MLA 形狀走 MKL flash attention,此前該形狀因 K/V 寬度不一致、head dim 上限 512 被排程器拒絕,預填充只能回退到更慢的 TILE kernel。在 Intel Arc Pro B70 上,pp8192 從 432.80 提升到 1292.29 tok/s(2.99 倍,+198.6%),tg256 在噪聲範圍內基本不變(45.67 對 45.65)。

llama.cpp releases10/4 01:37AI 評分33

llama.cpp 為 WebGPU 後端加入 f16 支援

llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…

llama.cpp releases10/4 18:49AI 評分35

llama.cpp 發布 b11396 版本,Windows LLVM 建置需 Ninja 多配置

llama.cpp 發布 b11396 版本,主要變更是 Windows 平台的 LLVM 建置需要 Ninja 多配置(#29959)。該版本提供覆蓋 macOS、Linux、Windows、Android 和 openEuler 的預編譯產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 被標記為…

llama.cpp releases10/5 14:23AI 評分49

llama.cpp 最佳化 CUDA 後端 NVFP4 的 mmq 累加

llama.cpp 發布 b11417 建置,CUDA 後端針對 NVFP4 型別的 mmq 累加做了最佳化,改進 mmq_vec_dot_fp4_fp4_mma 以提升效能,並修正 mma_block_scaled_fp4 迴圈的縮排。該版本建置覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12.8、CUDA 13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;

llama.cpp releases10/4 20:50AI 評分23

llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置

llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;

llama.cpp releases10/4 13:34AI 評分36

llama.cpp 修復 Vulkan 後端 RDNA4 矩陣向量調優

llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。

llama.cpp releases10/5 09:19AI 評分12

llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤

llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。

llama.cpp releases10/7 06:02AI 評分36

llama.cpp 發布 b11459:ggml-webgpu 在 WASI 上停用 Dawn 原生特性

llama.cpp 發布建置 b11459,唯一列出的程式碼改動是 ggml-webgpu 在 WASI 上不再啟用 Dawn 原生特性。該建置的預編譯產物覆蓋 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework、Linux、Android、Windows 以及 openEuler。後端包括 CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO 與 SYCL;

llama.cpp releases10/5 15:50AI 評分42

llama.cpp 發布 b11424,修復 Vulkan Flash Attention 共享記憶體越界寫

llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。

llama.cpp releases10/6 22:09AI 評分41

llama.cpp b11456:CUDA 緩衝區初始化改用每執行緒流

llama.cpp 發布建置 b11456,其中 ggml-cuda 在緩衝區初始化的 padding memset 中改用每執行緒 stream(#28782),CI 也重新為 ROCm 啟用 test-backend-ops 的 -j 並行測試。該建置覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,含 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等後端;

llama.cpp releases10/5 16:21AI 評分43

llama.cpp 發布 b11425:CUDA alloc_deps 檢查改為與 batch 無關

llama.cpp 發布 b11425 建置,主要變更是把 CUDA 後端的 alloc_deps 檢查改為與 batch 無關(PR #29986,修復 #29980)。該版本同時更新各平台預編譯產物,覆蓋 macOS Apple Silicon 與 Intel、iOS XCFramework、Android arm64,以及 Windows 和 Ubuntu 上的 CUDA 12、CUDA 13、Vulkan、ROCm 10.0、SYCL、OpenVINO 等後端。

llama.cpp releases10/3 22:09AI 評分27

llama.cpp 發布新版本,將 cpp-httplib 升級至 0.59.0

llama.cpp 發布更新,將依賴庫 cpp-httplib 升級到 0.59.0,對應 PR #29886。該版本繼續提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯建置,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 以及 Snapdragon 的 CPU、Adreno GPU 和 Hexagon NPU 等後端。

llama.cpp releases10/2 23:23AI 評分37

llama.cpp 發布 b11352 版本,最佳化 Qwen4 掩碼構造

llama.cpp 發布 b11352 建置版本,主要變更為最佳化 Qwen4 的掩碼構造(#29824),並將相同改動應用到 GLM5-next。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等多種後端建置,其中 macOS Apple Silicon 的 KleidiAI 建置被標記為 DISABLED。

llama.cpp releases● 精選10/5 17:57AI 評分62

llama.cpp 版本號升至 0.6.0,多平台建置產物同步更新

llama.cpp 將版本號提升到 0.6.0(PR #29997),並更新了 scripts 的 summary prompt。隨版本給出的建置產物覆蓋 macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,含 CUDA 12、CUDA 13、ROCm 10.0、Vulkan、OpenVINO、SYCL)、Android arm64、Windows(x64/arm6…

llama.cpp releases10/3 14:27AI 評分27

llama.cpp 修復 f16 ADD_ADD 不穩定測試併發布多平台建置

llama.cpp 合併 PR #29904,通過改用融合 ADD 容差修復 f16 下 ADD_ADD 測試的 flaky 問題。隨附的建置覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 及 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 版本和 openEuler 被標記為 DISABL…

llama.cpp releases10/7 07:53AI 評分42

llama.cpp 發布 b11461,修復 AMD 核顯 Vulkan 檢查點讀取慢

llama.cpp 發布 b11461,主要改動是修復 AMD 整合顯示卡在 Vulkan 後端下檢查點(checkpoint)讀取過慢的問題,對應 PR #30049。該版本同時更新了 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 後端。

llama.cpp releases10/4 10:37AI 評分27

llama.cpp 修復預設白名單中失效的 LLAMA_ARG_HF_REPO_FILE 鍵

llama.cpp 發布 b11385 版本,修復了預設允許列表中失效的 LLAMA_ARG_HF_REPO_FILE 鍵(#29938)。該版本繼續為 macOS、Linux、Windows、Android 等平台提供建置,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版與 openEuler 建置被標記為 DISABLED…

llama.cpp releases10/4 11:03AI 評分29

llama.cpp 發布 b11386,為路徑轉換準備 load_from_models_dir()

llama.cpp 發布 b11386 版本,提交內容是為路徑轉換準備 load_from_models_dir(),屬於 fs::path 現代化系列的一部分,並藉此機會移除了 fs_list()。該版本同步提供 macOS、Linux、Windows、Android 及 openEuler 等多平台建置產物,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端。

llama.cpp releases10/6 19:16AI 評分40

llama.cpp b11447 發布:新增 pplx-decider 模型支援

llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;