llama.cpp b11456:CUDA 緩衝區初始化改用每執行緒流
llama.cpp 發布建置 b11456,其中 ggml-cuda 在緩衝區初始化的 padding memset 中改用每執行緒 stream(#28782),CI 也重新為 ROCm 啟用 test-backend-ops 的 -j 並行測試。該建置覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,含 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等後端;
原標題:b11456
閱讀原文
| 評分 | 45 / 38(平均 41,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 發布 b11425:CUDA alloc_deps 檢查改為與 batch 無關
llama.cpp 發布 b11425 建置,主要變更是把 CUDA 後端的 alloc_deps 檢查改為與 batch 無關(PR #29986,修復 #29980)。該版本同時更新各平台預編譯產物,覆蓋 macOS Apple Silicon 與 Intel、iOS XCFramework、Android arm64,以及 Windows 和 Ubuntu 上的 CUDA 12、CUDA 13、Vulkan、ROCm 10.0、SYCL、OpenVINO 等後端。
llama.cpp 發布 b11391 版本,CUDA 程式碼小幅調整
llama.cpp 發布 b11391 建置版本,唯一程式碼改動是將 CUDA 後端的 blocks_per_col 變數移到實際使用位置(PR #29939),由 Hugging Face 的 Adrien Gallouët 提交。
llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置
llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp 建置 b11448:ggml-cuda 分塊處理大塊 BF16/FP16 轉 F32
llama.cpp 發布建置 b11448,ggml-cuda 後端把大塊 BF16/FP16 到 F32 的轉換改為分塊執行(#29442),並修正分塊 cuBLAS 矩陣乘法未遵循目標 stride 的問題,提交由 Johannes Gäßler 參與。改動僅涉及 CUDA 後端,影響用 NVIDIA GPU 做本地推理的場景;該建置同時覆蓋 macOS Apple Silicon 與 Linux、Windows 的 CUDA 12/13 等平台。
llama.cpp 發布 b11390,修復 CUDA MMQ 記憶體錯誤
llama.cpp 發布建置版本 b11390,主要修復了 CUDA 後端在 n_expert 遠大於 n_ubatch 時的 MMQ 記憶體故障(#29941)。