2026 年 10 月 6 日,Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,權重已上線 Hugging Face 與 Kaggle。它基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到統一的 768 維向量… 看完整事件
Google 發布 740M 引數開源多模態嵌入模型 EmbeddingGemma 2
Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,可把文字、程式碼、影像、音訊、影片對映到同一嵌入空間。它基於 Gemma 4 架構,可拆分出 270M 純文字、170M 視覺與 300M 音訊編碼器,並用 MRL 把輸出向量從 768 維截斷到 128 維,本地向量庫儲存最多省 6 倍。
前代 EmbeddingGemma 下載超 2000 萬次後,這版把嵌入從純文字擴充套件到影像、音訊與影片,並給出 MTEB Code 提升 9.92 分和 Pixel 上的記憶體實測值,對在本地做多模態檢索與 RAG 的開發者最有用。
原標題:EmbeddingGemma 2: an open, lightweight multimodal embedding model
閱讀原文
| 評分 | 89 / 82(平均 85,門檻 60) |
|---|---|
| 狀態 | 精選 |
相關報導
為什麼嵌入模型常用 1536 維?
有使用者在討論區提問,為什麼嵌入模型常選擇 1536 維,而非 1024 或 2048。提問者已理解 64/128/256/512 等硬體友好倍數的意義,但好奇 1536=3×512 這一具體選擇的原因。OpenAI 曾使用 1536 維嵌入,其他廠商也提供或推薦該維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的特殊便利,並希望有實際訓練或設計嵌入模型的人回答。
Google 發布 Gemini 4 Argon 等 9 月 AI 更新
Google 在 9 月發布新一代前沿模型 Gemini 4 Argon,具備先進推理能力與 100 萬 token 輸出上限,目前通過 Fairwind Program 向受信任的網路安全防禦方分階段開放。