AISpot
所屬事件:Google 發布 EmbeddingGemma 2,llama.cpp 首日支援(2 個來源 · 3 則報導)

2026 年 10 月 6 日,Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。官方首批推文只給出定位,未提及引數規模、上下文長度與適配硬體;隨後補充說明該模型為 740M 引數,在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型把文字之外… 看完整事件

@GoogleDeepMind: At 740M parameters, it’s competitive across benchmarks – even outperforming some specialist models …

X @GoogleDeepMind10/6 17:04官方公告模型開源地端推論開發工具

Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。

740M 的小體量嵌入模型在基準上反超兩倍引數量的專用模型,且以 Apache 2.0 直接放出權重,對做多模態檢索和端側 RAG 的開發者有直接參考價值。

原標題:@GoogleDeepMind: At 740M parameters, it’s competitive across benchmarks – even outperforming some specialist models …
閱讀原文

同一事件共有 3 則報導(2 個來源),看事件全貌

評分78 / 82(平均 80,門檻 60)
狀態精選

相關報導

Latent Space● 精選10/1 07:45AI 評分92

Gemini 4 Argon 發布:輸出上限 1M token,限網路安全預覽

Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。

r/OpenAI top of the day10/3 06:38AI 評分33

為什麼嵌入模型常用 1536 維?

有使用者在討論區提問,為什麼嵌入模型常選擇 1536 維,而非 1024 或 2048。提問者已理解 64/128/256/512 等硬體友好倍數的意義,但好奇 1536=3×512 這一具體選擇的原因。OpenAI 曾使用 1536 維嵌入,其他廠商也提供或推薦該維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的特殊便利,並希望有實際訓練或設計嵌入模型的人回答。

Hacker News front page10/3 10:13AI 評分58

Google 取消 Gemini Flash 與 Pro 模型免費使用

Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。

llama.cpp releases● 精選10/3 12:54AI 評分70

llama.cpp 的 OpenVINO 後端更新至 2026.4.1 並大幅最佳化 MoE 效能

ggml-openvino 後端更新到 2026.4.1,重點最佳化 Qwen3.5 MoE 推理效能,並新增推理效能分析、預設使用遠端輸出張量、磁碟快取模型直載(cache_only)等能力。在 Arc B390 上以 q4_asym64_all 重量化執行 gemma-4-26B-A4B,pp512 從 66.16 t/s 提升到 1608.73 t/s,tg128 從 25.94 提升到 26.46 t/s,困惑度基本不變。

r/LocalLLaMA top of the day● 精選10/3 12:44AI 評分80

Aleph Alpha 發布 Kolibri-1:78B 引數 MoE 開源模型,Apache 2.0

德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,總引數 78B、啟用 3.46B,支援最高 100 萬 token 上下文,採用 Apache 2.0 許可。模型基於 20T token 的英德雙語語料訓練(約 62.5% 英語、23.9% 德語、13.6% 程式碼),在 768 張 B300 叢集上訓練約 4 周。社群討論認為其基準表現接近 Qwen 3.5 35B,適合 96GB 視訊記憶體本地部署,但目前尚無量化版本。