llama.cpp b11537 修復 Gemma 4 embedding 並改進建置邏輯
llama.cpp 發布 b11537,重點是修復 Gemma 4 的 embedding 相關問題、改進輸入 embedding 的建置邏輯。該版本在 graph 中重排了 embeddings 使用的 get_rows,修好 raw embeddings 路徑,在 Gemma 4 的 embedding 路徑中避免 ple cast,併為 LoRA 留下 TODO。
原標題:b11537
閱讀原文
| 評分 | 45 / 38(平均 41,門檻 60) |
| 狀態 | 未入選 |
|---|
原文
graph : reorder get_rows for embeddings ( #30160 )
graph : reorder get_rows for embeddings
cont : fix gemma4 and improve input embedding construction logic
cont : add TODO for lora
cont : fix raw embeddings path
gemma4 : avoid ple cast in embeddings path
Website:
https://llama.app
Attestations:
https://github.com/ggml-org/llama.cpp/attestations/54446845
macOS/iOS:
macOS Apple Silicon (arm64)
macOS Apple Silicon (arm64, KleidiAI enabled) DISABLED
macOS Intel (x64)
iOS XCFramework
Linux:
Ubuntu x64 (CPU)
Ubuntu arm64 (CPU)
Ubuntu s390x (CPU)
Ubuntu x64 (Vulkan)
Ubuntu arm64 (Vulkan)
Ubuntu x64 (CUDA 12) - CUDA 12.8 libraries
Ubuntu x64 (CUDA 13) - CUDA 13.4 libraries
Ubuntu arm64 (CUDA 13) - CUDA 13.4 libraries
Ubuntu x64 (ROCm 10.0)
Ubuntu x64 (OpenVINO)
Ubuntu x64 (SYCL FP32)
Ubuntu x64 (SYCL FP16)
Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Android:
Android arm64 (CPU)
Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Windows:
Windows x64 (CPU)
Windows arm64 (CPU)
Windows arm64 (OpenCL Adreno)
Windows x64 (CUDA 12) - CUDA 12.4 DLLs
Windows x64 (CUDA 13) - CUDA 13.4 DLLs
Windows arm64 (CUDA 13) - CUDA 13.4 DLLs
Windows x64 (Vulkan)
Windows arm64 (Vulkan)
Windows x64 (OpenVINO)
Windows x64 (SYCL)
Windows x64 (ROCm 10.0)
openEuler:
DISABLED
openEuler x86 (310p)
openEuler x86 (910b, ACL Graph)
openEuler aarch64 (310p)
openEuler aarch64 (910b, ACL Graph)
UI:
UI
相關報導
X @ggerganov● 精選AI 評分69
llama.cpp 已實現對 EmbeddingGemma 2 的 Day-0 支援,由作者 ggerganov 公布。對應 GGUF 權重由 ggml-org 發布在 Hugging Face,可直接下載用於本地推理。Day-0 意味著模型發布當天即可在 llama.cpp 上執行,無需等待社群自行轉換。
llama.cpp releasesAI 評分36
llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。
llama.cpp releasesAI 評分43
llama.cpp 發布 b11451 建置,主要變更是修復 OpenCL 後端在 Adreno GPU 上 xmem GEMM 的越界讀取(OOB read)問題,對應 PR #30041。
llama.cpp releasesAI 評分43
llama.cpp 發布建置 b11512,首要改動是修復 DFlash 模型的輸出頭共享問題。該版本改為從 GGUF 後設資料讀取繫結的輸出權重、共享繫結的詞嵌入後設資料,並移除 DFlash 嵌入頭回退邏輯,這幾項改動均由 Codex 協助完成。
llama.cpp releasesAI 評分37
llama.cpp 發布 b11352 建置版本,主要變更為最佳化 Qwen4 的掩碼構造(#29824),並將相同改動應用到 GLM5-next。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等多種後端建置,其中 macOS Apple Silicon 的 KleidiAI 建置被標記為 DISABLED。