2026 年 10 月 6 日,Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。官方首批推文只給出定位,未提及引數規模、上下文長度與適配硬體;隨後補充說明該模型為 740M 引數,在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型把文字之外… 看完整事件
llama.cpp 首日支援 EmbeddingGemma 2
llama.cpp 已實現對 EmbeddingGemma 2 的 Day-0 支援,由作者 ggerganov 公布。對應 GGUF 權重由 ggml-org 發布在 Hugging Face,可直接下載用於本地推理。Day-0 意味著模型發布當天即可在 llama.cpp 上執行,無需等待社群自行轉換。
llama.cpp 作者本人確認的 Day-0 支援並附 ggml-org 官方 GGUF 權重,對關注本地推理與嵌入模型的開發者有直接參考價值。
原標題:@ggerganov: Day-0 support for EmbeddingGemma 2 in llama.cpp
閱讀原文
| 評分 | 72 / 66(平均 69,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
llama.cpp 發布 b11438,動態後端需顯式載入
llama.cpp 發布 b11438,主要變更是 test-llama-archs 在生成模型前先初始化後端(#30034):開啟 GGML_BACKEND_DL 時,必須先顯式載入後端才能建立模型。
llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援
llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。
llama.cpp 發布 b11384 版本,覆蓋多平台預編譯包
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。
llama.cpp b11436 修復 OpenVINO 後端多項 GPU 迴歸
llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;
llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置
llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;