10 月 6 日,Google DeepMind 發布 EmbeddingGemma 2,官方稱其為首個原生多模態的端側嵌入開放模型。該模型為 740M 引數,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到統一的 768 維向量空間,以 Apache 2.0 許可開源,權重已上線 Hugging F… 看完整事件
Google 發布 EmbeddingGemma 2,740M 引數開源端側多模態嵌入模型
Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。
把文字、程式碼、影像、音訊與影片統一進單一端側嵌入空間,並給出 740M 引數下的記憶體佔用、8K 上下文與 MTEB Code 提升 9.92 分的具體資料,對做本地 RAG 與多模態檢索的開發者最有用。
原標題:EmbeddingGemma 2
閱讀原文
| 評分 | 90 / 80(平均 85,門檻 76) |
|---|---|
| 狀態 | 精選 |
相關報導
Gemini 4 Argon 發布:輸出上限 1M token,限網路安全預覽
Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。
為什麼嵌入模型常用 1536 維?
有使用者在討論區提問,為什麼嵌入模型常選擇 1536 維,而非 1024 或 2048。提問者已理解 64/128/256/512 等硬體友好倍數的意義,但好奇 1536=3×512 這一具體選擇的原因。OpenAI 曾使用 1536 維嵌入,其他廠商也提供或推薦該維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的特殊便利,並希望有實際訓練或設計嵌入模型的人回答。
Google 取消 Gemini Flash 與 Pro 模型免費使用
Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。