AISpot
所屬事件:Google 發布 EmbeddingGemma 2 開源多模態嵌入模型(7 個來源 · 10 則報導)

2026 年 10 月 6 日,Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,權重已上線 Hugging Face 與 Kaggle。它基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到統一的 768 維向量… 看完整事件

Google 發布 740M 引數開源多模態嵌入模型 EmbeddingGemma 2

Google DeepMind blog10/6 20:57官方公告模型開源地端推論

Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,可把文字、程式碼、影像、音訊、影片對映到同一嵌入空間。它基於 Gemma 4 架構,可拆分出 270M 純文字、170M 視覺與 300M 音訊編碼器,並用 MRL 把輸出向量從 768 維截斷到 128 維,本地向量庫儲存最多省 6 倍。

前代 EmbeddingGemma 下載超 2000 萬次後,這版把嵌入從純文字擴充套件到影像、音訊與影片,並給出 MTEB Code 提升 9.92 分和 Pixel 上的記憶體實測值,對在本地做多模態檢索與 RAG 的開發者最有用。

原標題:EmbeddingGemma 2: an open, lightweight multimodal embedding model
閱讀原文

同一事件共有 10 則報導(7 個來源),看事件全貌

評分89 / 82(平均 85,門檻 60)
狀態精選

相關報導

r/OpenAI top of the day10/3 06:38AI 評分33

為什麼嵌入模型常用 1536 維?

有使用者在討論區提問,為什麼嵌入模型常選擇 1536 維,而非 1024 或 2048。提問者已理解 64/128/256/512 等硬體友好倍數的意義,但好奇 1536=3×512 這一具體選擇的原因。OpenAI 曾使用 1536 維嵌入,其他廠商也提供或推薦該維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的特殊便利,並希望有實際訓練或設計嵌入模型的人回答。