Google 發布 EmbeddingGemma 2,統一五種模態嵌入
Google 發布 EmbeddingGemma 2,一個把文字、程式碼、影像、影片和音訊對映到同一嵌入空間的多模態嵌入模型。它採用 740M 引數與模組化編碼器,面向端側場景最佳化;藉助 Matryoshka 表示學習支援 768 到 128 維的靈活維度,上下文視窗 8K,是純文字版 EmbeddingGemma 的 4 倍,並以 Apache 2.0 許可開放商用。
依意思最接近的 30 筆
Google 發布 EmbeddingGemma 2,一個把文字、程式碼、影像、影片和音訊對映到同一嵌入空間的多模態嵌入模型。它採用 740M 引數與模組化編碼器,面向端側場景最佳化;藉助 Matryoshka 表示學習支援 768 到 128 維的靈活維度,上下文視窗 8K,是純文字版 EmbeddingGemma 的 4 倍,並以 Apache 2.0 許可開放商用。
Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。
EmbeddingGemma 2 是一個 740M 引數的開源權重多模態模型,把文字、影像、影片與音訊對映到統一向量空間,面向隱私優先的端側檢索。開發者可用 MediaPipe Tasks 跨平台整合,或通過 LiteRT 在 CPU、GPU、NPU 上做細粒度效能最佳化。模型支援邊輸入邊搜的媒體檢索、影片關鍵幀定位與零樣本意圖路由等超低延遲本地場景。
EmbeddingGemma 2 是一個緊湊的開源多模態嵌入模型,把文字、程式碼、影像、影片和音訊對映到統一的 768 維向量空間。開發者可通過 sentence-transformers 庫選擇性載入模組化模態編碼器,引數量在 270M 到 740M 之間,以最佳化記憶體佔用。模型還採用 Matryoshka 表示學習,支援將維度動態截斷至 128 維,在保持較高檢索效能的同時顯著降低向量資料庫的儲存需求。
Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。
Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,可把文字、程式碼、影像、音訊、影片對映到同一嵌入空間。它基於 Gemma 4 架構,可拆分出 270M 純文字、170M 視覺與 300M 音訊編碼器,並用 MRL 把輸出向量從 768 維截斷到 128 維,本地向量庫儲存最多省 6 倍。
Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。
Google DeepMind 的 EmbeddingGemma 2 已上線 Ollama,執行 ollama pull embeddinggemma-2 即可拉取。訊息由 Ollama 官方帳號在 10 月 6 日發布,官方稱該模型面向消費級裝置,並且是多模態模型。原文未披露模型體積、上下文長度與具體支援的模態等細節。
EmbeddingGemma 2 採用 Apache 2.0 許可,Hacker News 上有評論認為嵌入模型不適合閉源、僅託管的形式。原因是嵌入模型往往要計算並長期儲存成千上萬乃至數百萬條向量,廠商一旦停供該模型,使用者就得為重新計算這些向量付費。評論提到 OpenAI 曾在 2024 年 4 月表示承擔使用者用新模型重新嵌入的費用,但並非所有供應商都能如此。評論者本人不願自託管,傾向付費使用託管服務,同時保留廠商停服後自行執行開放權重版本的選項。
Ollama 模型庫新增 Google DeepMind 的 embeddinggemma-2 頁面,地址為 ollama.com/library/embeddinggemma-2,使用者可通過 Ollama 拉取該嵌入模型。該條目由 Ollama 官方帳號發布,指向 Google DeepMind 的這一模型。原文未給出模型規模、上下文長度、許可證或效能資料等細節。
llama.cpp 已實現對 EmbeddingGemma 2 的 Day-0 支援,由作者 ggerganov 公布。對應 GGUF 權重由 ggml-org 發布在 Hugging Face,可直接下載用於本地推理。Day-0 意味著模型發布當天即可在 llama.cpp 上執行,無需等待社群自行轉換。
Ollama 發布 v0.40.0-rc6,在 MLX runner 上實現 EmbeddingGemma2Model 架構,使本地嵌入支援多模態輸入。/api/embed 介面現在可通過 input dict 為每個條目單獨傳入媒體。該模型為 24 層雙向文字編碼器,帶 PLE,共享 gemma4 的視覺與音訊塔,輸出經 mean-pool 與 L2 歸一化。該標籤由 pdevine 於 10 月 6 日打上,對應提交 #18820,仍屬 rc 預發布版本。
OpenAI 宣布將在歐盟自動為 ChatGPT 生成的文字加水印,其他地區也提供該功能,但預設關閉。這是為遵守 8 月生效的歐盟 AI Act,該法要求 AI 生成內容可被其他工具檢測。OpenAI 的水印方法名為 textGrain,屬專有技術並已發布技術論文:它在用詞中埋入人類難以察覺、也不影響輸出品質的模式,持有金鑰者可用專用檢測器識別。檢測器初期只向有限的研究者與機構開放,其他方需經申請審批逐步加入。
Google 在 9 月發布新一代前沿模型 Gemini 4 Argon,具備先進推理能力與 100 萬 token 輸出上限,目前通過 Fairwind Program 向受信任的網路安全防禦方分階段開放。
Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。
OpenAI 宣布將在歐盟為 ChatGPT 和 Codex 生成的文字加入隱形水印,以符合 8 月 2 日生效的 EU AI Act 透明度規則。水印將在未來幾週內推送給歐盟所有套餐的合格使用者;全球 API 開發者即日起可為部分模型開啟,預設關閉,暫不設為全球預設。該方法名為 textGrain,通過微呼叫詞留下可被檢測器識別的模式,隨複製貼上保留,OpenAI 稱不影響模型表現。
Google 於 10 月 1 日突然發布 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超過 Claude Opus 5.5 和 GPT-6 Astra,Vals Index 以 68.90% 登頂,Text Arena 以 1525 分居首。優惠期單題成本約低四成,每百萬輸入 Token 2 美元、輸出 Token 10 美元,支援百萬 Token 輸出。目前僅開放給經篩選的網路安全團隊,通過 Fairwind 計劃使用,其他訂閱使用者需等待。
Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。
Google DeepMind 正式發布 Nano Banana 2.1,底層由 Gemini 3.6 Flash 驅動,模型 ID 為 gemini-nano-banana-2.1,已作為穩定模型上線 Gemini App、AI Studio、Gemini API、Search AI Mode、Google Ads、Flow 與 Stitch。新版定位高效率影像生成與對話式編輯,支援 1K/2K/4K 輸出、最多 14 張參考圖融合,重點強化設計版式、蒙版區域性編輯和主體一致性;
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
Google DeepMind 發布 SynthID Bio,一套面向 AI 生成生物設計的水印方法。官方稱這是全球首次能在不影響生物功能的前提下,把不可感知的簽名直接嵌入蛋白質序列。該技術屬於 SynthID 水印體系的新分支,具體覆蓋範圍、檢測方式與可用時間尚未公布。
為滿足歐盟 AI 法案的監管要求,OpenAI 將內容溯源範圍從影像、音訊擴充套件到文字,未來幾週內在歐盟開始對 ChatGPT 和 Codex 的合規文字加水印。其 API 客戶即日起可在全球範圍內為部分模型開啟文字水印。OpenAI 同時承認,當前文字水印技術存在明顯侷限。
Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。
llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;
OpenAI 公布應對歐盟 AI 法案的文字溯源方案:全球 API 客戶即日起可為部分模型選擇開啟文字水印(預設關閉),未來幾週將在歐盟的 ChatGPT 與 Codex 文字輸出中加入不可見水印,檢測器僅向獲批研究者與專家組織開放申請。其自研 textGrain 通過統計訊號標記用詞,在 1% 誤報率下對 200 token 段落檢出約 80%、400 token 約 95%,數學等用詞受限內容明顯更低;
從 10 月 9 日起,Google Gemini 免費方案使用者只能使用 Flash Lite 模型,此前免費使用者可在 Flash Lite、Flash 和 Pro 之間選擇。標準 Flash 模型改為需要每月 4.99 美元的 Google AI Plus 訂閱,而該訂閱也將不再包含 Gemini Pro,Google 表示會發郵件通知 AI Plus 使用者何時失去存取權限。
有使用者在討論區提問,為什麼嵌入模型常選擇 1536 維,而非 1024 或 2048。提問者已理解 64/128/256/512 等硬體友好倍數的意義,但好奇 1536=3×512 這一具體選擇的原因。OpenAI 曾使用 1536 維嵌入,其他廠商也提供或推薦該維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的特殊便利,並希望有實際訓練或設計嵌入模型的人回答。
OpenAI 開始在 ChatGPT 和 Codex 的文字輸出中加入不可見、機器可讀的水印,初期只面向歐盟使用者。OpenAI 稱自研的 textGrain 水印與 Google DeepMind 的 SynthID for text 等方法相比持平或更優,後者也是 Anthropic 8 月宣布的水印基礎;兩家公司都是為了滿足歐盟 AI Act 的要求。OpenAI 還給出 AI 基準分數,顯示加水印與未加水印文字表現相近,但表示 textGrain 並不保證……
Google 週二上線 SynthID 驗證網站,任何人可上傳圖片、影片或音訊,檢查是否為 AI 生成。該工具此前只向部分記者、媒體從業者和研究人員開放測試,現已全面開放,支援 JPG、PNG、HEIC、MP4、MP3、WAV 等十餘種格式。SynthID 自 2023 年推出,Google 的 Nano Banana、Veo、Lyria 模型以及 Gemini、Flow、Vids 等生成工具都會為產出加水印,OpenAI、Nvidia、Kakao 也已支援。
Gemini Nano Banana 2.1(gemini-nano-banana-2.1)已正式 GA,這是最新的高效率影像生成與對話式編輯模型,也是 gemini-3.1-flash-image 的更新版本。它在保持 Flash 級速度與成本效率的同時,提升了視覺品質、提示詞遵循、多輪角色一致性、文字渲染,並支援 1:4、4:1、1:8、8:1 的寬幅與全景比例,覆蓋 1K、2K、4K 解析度。