llama.cpp b11537 修復 Gemma 4 embedding 並改進建置邏輯
llama.cpp 發布 b11537,重點是修復 Gemma 4 的 embedding 相關問題、改進輸入 embedding 的建置邏輯。該版本在 graph 中重排了 embeddings 使用的 get_rows,修好 raw embeddings 路徑,在 Gemma 4 的 embedding 路徑中避免 ple cast,併為 LoRA 留下 TODO。
找到 5 筆
llama.cpp 發布 b11537,重點是修復 Gemma 4 的 embedding 相關問題、改進輸入 embedding 的建置邏輯。該版本在 graph 中重排了 embeddings 使用的 get_rows,修好 raw embeddings 路徑,在 Gemma 4 的 embedding 路徑中避免 ple cast,併為 LoRA 留下 TODO。
Ollama 發布 v0.40.0-rc6,在 MLX runner 上實現 EmbeddingGemma2Model 架構,使本地嵌入支援多模態輸入。/api/embed 介面現在可通過 input dict 為每個條目單獨傳入媒體。該模型為 24 層雙向文字編碼器,帶 PLE,共享 gemma4 的視覺與音訊塔,輸出經 mean-pool 與 L2 歸一化。該標籤由 pdevine 於 10 月 6 日打上,對應提交 #18820,仍屬 rc 預發布版本。
Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。
llama.cpp 合併 PR #29903,通過將 n_batch 限制為不超過 n_ubatch 來修復 server 崩潰問題,對應 issue #29902。該修復由 Claude 輔助完成,並移除了相關測試與 embeddings 條件。新版本已覆蓋 macOS、Linux、Windows、Android 等平台,包括 Apple Silicon、CUDA、ROCm、Vulkan 等後端。
OpenRouter 上線 Batch API,把請求打包提交後由服務商在 24 小時內擇時完成,換取約為正常每 token 價格 50% 的折扣,目前已支援 70 多個模型。兩週 beta 期間 23 萬多個批次的中位完成時間為 7 分鐘,90% 在一小時內完成;太平洋時間凌晨 5 點到中午提交明顯更慢。支援 chat completions、responses、messages 和 embeddings,輸入結果保留 30 天,圖片和檔案需用公開 URL。