AISpot
所屬事件:Google 發布 EmbeddingGemma 2,llama.cpp 首日支援(2 個來源 · 3 則報導)

2026 年 10 月 6 日,Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。官方首批推文只給出定位,未提及引數規模、上下文長度與適配硬體;隨後補充說明該模型為 740M 引數,在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型把文字之外… 看完整事件

llama.cpp 首日支援 EmbeddingGemma 2

X @ggerganov10/6 17:49版本更新地端推論開源模型

llama.cpp 已實現對 EmbeddingGemma 2 的 Day-0 支援,由作者 ggerganov 公布。對應 GGUF 權重由 ggml-org 發布在 Hugging Face,可直接下載用於本地推理。Day-0 意味著模型發布當天即可在 llama.cpp 上執行,無需等待社群自行轉換。

llama.cpp 作者本人確認的 Day-0 支援並附 ggml-org 官方 GGUF 權重,對關注本地推理與嵌入模型的開發者有直接參考價值。

原標題:@ggerganov: Day-0 support for EmbeddingGemma 2 in llama.cpp
閱讀原文

同一事件共有 3 則報導(2 個來源),看事件全貌

評分72 / 66(平均 69,門檻 65)
狀態精選

相關報導

llama.cpp releases● 精選10/5 17:58AI 評分82

llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援

llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。

llama.cpp releases10/6 07:57AI 評分45

llama.cpp b11436 修復 OpenVINO 後端多項 GPU 迴歸

llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;

llama.cpp releases10/4 20:50AI 評分23

llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置

llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;