搜尋
找到 24 筆
llama.cpp releases10/4 21:07AI 評分45
llama.cpp 的 ggml-cpu 後端在 x86 上為 tinyBLAS 增加了 BF16、FP16、FP32 的 K 尾部支援並做了向量化,同時讓 CPU 測試在啟用 use_ref 時跳過 tinyBLAS,以便與 vec_dot 路徑對比。改動以 PR #29806 合入,隨 b11398 建置發布,覆蓋 macOS、Linux、Windows、Android 等多平台 CPU 與 GPU 後端。
llama.cpp releases10/6 07:18AI 評分47
llama.cpp 合併 PR #29994,修復 CPU 後端在共享序列(seq_cp)場景下 k-pool 的散射寫入資料競爭:多個共享同一 cell 的序列會從不同 scatter 條目寫同一 rep 行。
llama.cpp releases● 精選10/7 15:28AI 評分74
llama.cpp 合併 PR #30100,修復 Metal 後端 MUL_MAT+ADD 融合中殘差運算元的選擇錯誤:當 ADD 的兩個運算元都是矩陣乘法輸出(x = W1@u + W2@v)時,舊邏輯會選中自身從未寫入的輸出緩衝區,導致結果錯誤。Clef 決策模型因此在 Metal 上機率趨近均勻,billing 輸出 0.28,而 CPU 後端為 0.977,且同一檔案在 CPU 上結果正確,說明並非量化問題。
llama.cpp releases10/3 02:32AI 評分37
llama.cpp 合併 PR #27096,修復 ggml-cpu 後端 GGML_OP_SOFT_MAX_BACK 在 dst 與 src1(y)別名時輸出靜默錯誤的問題:原實現先覆蓋 y 再讀取,導致結果錯誤。補丁改為單次融合迴圈,先讀兩個輸入再寫出,並新增迴歸測試強制觸發該別名。CUDA 核心因先完成歸約再寫出,不受影響。
llama.cpp releases10/6 07:57AI 評分45
llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;
llama.cpp releases10/4 01:37AI 評分33
llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…
llama.cpp releases10/5 09:19AI 評分12
llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。
llama.cpp releases10/6 19:51AI 評分46
ggml 修復了 CLAMP 運算元在非連續檢視上的定址錯誤,涉及 CPU 與 CUDA 後端。CUDA 此前按 ggml_nelements 做平坦處理、忽略檢視 stride,CPU 則把第 j 行按 j*nb01 定址、忽略 nb02/nb03;現在兩者都改為遵循 dims 1..3 的 stride,且 CUDA 的 supports_op 要求行連續,與 Metal 一致。
llama.cpp releases10/2 19:55AI 評分45
llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 方法,並公開 API ggml_backend_buft_alloc_buffer_n,同時加入 get_alloc_size_n 與配套測試。預設實現負責多緩衝區拆分與張量分配,Meta 緩衝區型別提供按裝置建立子上下文的自訂實現;cpu、metal、openvino、hexagon、webgpu 等現有後端介面先置為 NULL。
llama.cpp releases10/5 15:50AI 評分42
llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。
llama.cpp releases10/7 07:53AI 評分42
llama.cpp 發布 b11461,主要改動是修復 AMD 整合顯示卡在 Vulkan 後端下檢查點(checkpoint)讀取過慢的問題,對應 PR #30049。該版本同時更新了 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 後端。
llama.cpp releases10/3 02:06AI 評分40
llama.cpp 發布 b11364 版本,新增對 nimble 決策模型的支援(PR #29844)。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL、Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端建置;
llama.cpp releases10/2 14:52AI 評分17
llama.cpp 發布 b11346 版本,主要變更是修復 qwen4exp 的測試(#29819)。該版本為 macOS、iOS、Linux、Android、Windows 和 openEuler 提供預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 及 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端;
llama.cpp releases10/4 09:06AI 評分20
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。
llama.cpp releases10/7 11:13AI 評分35
llama.cpp 發布 b11462 建置,本次合併的主要改動是 SYCL 後端的 fattn_kv_buffers 清理(#27689)。該版本繼續提供 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL,以及驍龍平台的 CPU、Adreno GPU 與 Hexagon NPU。
llama.cpp releases10/7 14:02AI 評分37
llama.cpp 發布 b11471 建置,主要變更是向詞表加入 Plamo 的 FIM(fill-in-the-middle)tokens,服務程式碼補全場景。該版本發布包覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,後端包含 CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU。
llama.cpp releases10/7 06:02AI 評分36
llama.cpp 發布建置 b11459,唯一列出的程式碼改動是 ggml-webgpu 在 WASI 上不再啟用 Dawn 原生特性。該建置的預編譯產物覆蓋 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework、Linux、Android、Windows 以及 openEuler。後端包括 CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO 與 SYCL;
llama.cpp releases10/6 22:09AI 評分41
llama.cpp 發布建置 b11456,其中 ggml-cuda 在緩衝區初始化的 padding memset 中改用每執行緒 stream(#28782),CI 也重新為 ROCm 啟用 test-backend-ops 的 -j 並行測試。該建置覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,含 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等後端;
llama.cpp releases10/3 22:09AI 評分27
llama.cpp 發布更新,將依賴庫 cpp-httplib 升級到 0.59.0,對應 PR #29886。該版本繼續提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯建置,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 以及 Snapdragon 的 CPU、Adreno GPU 和 Hexagon NPU 等後端。
llama.cpp releases10/2 23:23AI 評分37
llama.cpp 發布 b11352 建置版本,主要變更為最佳化 Qwen4 的掩碼構造(#29824),並將相同改動應用到 GLM5-next。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等多種後端建置,其中 macOS Apple Silicon 的 KleidiAI 建置被標記為 DISABLED。
llama.cpp releases10/7 13:28AI 評分35
llama.cpp 發布新建置 b11468,主要變更是將 cpp-httplib 升級到 0.60.0(#30081)。該版本同時提供 macOS/iOS、Linux、Windows、Android 與 openEuler 的預編譯產物,後端覆蓋 Apple Silicon arm64、CUDA 12.8 與 CUDA 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU 與…
llama.cpp releases10/2 14:11AI 評分43
llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。
llama.cpp releases10/6 19:16AI 評分40
llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;
MLX releases9/29 01:37AI 評分40
MLX 發布 v0.32.3,這是一個以修復為主的版本,涉及 Metal、CUDA 和 CPU 後端的大量 bug 修正。主要改動包括修復零尺寸軸掃描與排序、std/var 新增 correction 引數、修復 mx.clear_streams() 持有 GIL 導致的死鎖、修復整數負指數冪清零 SIMD 向量、修復 SGD 和 Adafactor 權重衰減修改呼叫方陣列、為 Metal 向量注意力新增 D512 支援、為 fast.cross_entropy 新增融合 M…