AISpot

搜尋

找到 5 筆

Ollama releases● 精選AI 評分76

Ollama v0.40.0-rc6 在 MLX 上加入多模態嵌入

Ollama 發布 v0.40.0-rc6,在 MLX runner 上實現 EmbeddingGemma2Model 架構,使本地嵌入支援多模態輸入。/api/embed 介面現在可通過 input dict 為每個條目單獨傳入媒體。該模型為 24 層雙向文字編碼器,帶 PLE,共享 gemma4 的視覺與音訊塔,輸出經 mean-pool 與 L2 歸一化。該標籤由 pdevine 於 10 月 6 日打上,對應提交 #18820,仍屬 rc 預發布版本。

X @GoogleDeepMind● 精選AI 評分73

@GoogleDeepMind: Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings.

Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。

llama.cpp releasesAI 評分20

llama.cpp 修復 server 因 n_batch 超限導致的 abort

llama.cpp 合併 PR #29903,通過將 n_batch 限制為不超過 n_ubatch 來修復 server 崩潰問題,對應 issue #29902。該修復由 Claude 輔助完成,並移除了相關測試與 embeddings 條件。新版本已覆蓋 macOS、Linux、Windows、Android 等平台,包括 Apple Silicon、CUDA、ROCm、Vulkan 等後端。

OpenRouter announcements● 精選AI 評分78

OpenRouter 推出 Batch API,批次推理半價

OpenRouter 上線 Batch API,把請求打包提交後由服務商在 24 小時內擇時完成,換取約為正常每 token 價格 50% 的折扣,目前已支援 70 多個模型。兩週 beta 期間 23 萬多個批次的中位完成時間為 7 分鐘,90% 在一小時內完成;太平洋時間凌晨 5 點到中午提交明顯更慢。支援 chat completions、responses、messages 和 embeddings,輸入結果保留 30 天,圖片和檔案需用公開 URL。