llama.cpp 更新:ModernBERT 編碼器改用精確 GELU
llama.cpp 發布 b11532 建置,ModernBERT 編碼器改用精確 GELU(exact GELU),替代此前的近似實現;同時保留 ggml_geglu 上的 tanh GELU 別名,並把 gelu_python 對映到 ggml_geglu_erf。
原標題:b11532
閱讀原文
| 評分 | 45 / 42(平均 43,門檻 60) |
| 狀態 | 未入選 |
|---|
原文
model : use exact GELU for ModernBERT encoders ( #30108 )
model : use exact GELU for ModernBERT encoders
Assisted-by: Codex
model : keep tanh GELU aliases on ggml_geglu
Assisted-by: Claude Opus 5.5
model : map gelu_python to ggml_geglu_erf
Assisted-by: Claude Opus 5.5
Website:
https://llama.app
Attestations:
https://github.com/ggml-org/llama.cpp/attestations/54401986
macOS/iOS:
macOS Apple Silicon (arm64)
macOS Apple Silicon (arm64, KleidiAI enabled) DISABLED
macOS Intel (x64)
iOS XCFramework
Linux:
Ubuntu x64 (CPU)
Ubuntu arm64 (CPU)
Ubuntu s390x (CPU)
Ubuntu x64 (Vulkan)
Ubuntu arm64 (Vulkan)
Ubuntu x64 (CUDA 12) - CUDA 12.8 libraries
Ubuntu x64 (CUDA 13) - CUDA 13.4 libraries
Ubuntu arm64 (CUDA 13) - CUDA 13.4 libraries
Ubuntu x64 (ROCm 10.0)
Ubuntu x64 (OpenVINO)
Ubuntu x64 (SYCL FP32)
Ubuntu x64 (SYCL FP16)
Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Android:
Android arm64 (CPU)
Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - setup guide
Windows:
Windows x64 (CPU)
Windows arm64 (CPU)
Windows arm64 (OpenCL Adreno)
Windows x64 (CUDA 12) - CUDA 12.4 DLLs
Windows x64 (CUDA 13) - CUDA 13.4 DLLs
Windows arm64 (CUDA 13) - CUDA 13.4 DLLs
Windows x64 (Vulkan)
Windows arm64 (Vulkan)
Windows x64 (OpenVINO)
Windows x64 (SYCL)
Windows x64 (ROCm 10.0)
openEuler:
DISABLED
openEuler x86 (310p)
openEuler x86 (910b, ACL Graph)
openEuler aarch64 (310p)
openEuler aarch64 (910b, ACL Graph)
UI:
UI
相關報導
llama.cpp releasesAI 評分45
llama.cpp 新建置 b11495 為 reranker 增加了 classifier_activation 引數,可以指定分類頭使用的啟用函式;gelu 現在對映到 gelu_erf 並接受 tanh,預設啟用函式改為 tanh,ModernBERT 則回退到 gelu_erf。
llama.cpp releasesAI 評分41
llama.cpp 發布 b11486 建置,Hexagon 後端的 GELU 啟用函式精度得到改進(#30104)。該版本繼續為驍龍平台提供 Hexagon NPU、Adreno GPU 與 CPU 三類後端,覆蓋 Linux arm64、Android arm64 與 Windows arm64。
llama.cpp releasesAI 評分41
llama.cpp 發布 b11537,重點是修復 Gemma 4 的 embedding 相關問題、改進輸入 embedding 的建置邏輯。該版本在 graph 中重排了 embeddings 使用的 get_rows,修好 raw embeddings 路徑,在 Gemma 4 的 embedding 路徑中避免 ple cast,併為 LoRA 留下 TODO。
X @ggerganov● 精選AI 評分69
llama.cpp 已實現對 EmbeddingGemma 2 的 Day-0 支援,由作者 ggerganov 公布。對應 GGUF 權重由 ggml-org 發布在 Hugging Face,可直接下載用於本地推理。Day-0 意味著模型發布當天即可在 llama.cpp 上執行,無需等待社群自行轉換。
llama.cpp releasesAI 評分33
llama.cpp 發布 b11438,主要變更是 test-llama-archs 在生成模型前先初始化後端(#30034):開啟 GGML_BACKEND_DL 時,必須先顯式載入後端才能建立模型。