AISpot

搜尋

依意思最接近的 30 筆

llama.cpp releases● 精選10/7 14:45AI 評分78

llama.cpp 合併 GLM5-Next MTP 支援,可作 draft 模型

llama.cpp 合併 PR #29928,為 GLM5-Next 加入多 token 預測(MTP)的 NextN 計算圖,使其能作為投機解碼的 draft 模型使用。改動包括支援只含 NextN 層或只含主幹張量的拆分 GGUF 檔案載入,並把 MTP 圖按輸出行裁剪,無輸出行的 4-token catch-up 核心耗時從 6.9 ms 降到 2.9 ms,貪心輸出雜湊與 draft 接受率不變。

llama.cpp releases10/2 23:23AI 評分37

llama.cpp 發布 b11352 版本,最佳化 Qwen4 掩碼構造

llama.cpp 發布 b11352 建置版本,主要變更為最佳化 Qwen4 的掩碼構造(#29824),並將相同改動應用到 GLM5-next。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等多種後端建置,其中 macOS Apple Silicon 的 KleidiAI 建置被標記為 DISABLED。

The Verge AI● 精選10/6 14:19AI 評分90

Google 10 月 9 日起將 Gemini 免費使用者限制為 Flash Lite

從 10 月 9 日起,Google Gemini 免費方案使用者只能使用 Flash Lite 模型,此前免費使用者可在 Flash Lite、Flash 和 Pro 之間選擇。標準 Flash 模型改為需要每月 4.99 美元的 Google AI Plus 訂閱,而該訂閱也將不再包含 Gemini Pro,Google 表示會發郵件通知 AI Plus 使用者何時失去存取權限。

Hacker News front page● 精選10/6 22:20AI 評分78

Google 發布 EmbeddingGemma 2,統一五種模態嵌入

Google 發布 EmbeddingGemma 2,一個把文字、程式碼、影像、影片和音訊對映到同一嵌入空間的多模態嵌入模型。它採用 740M 引數與模組化編碼器,面向端側場景最佳化;藉助 Matryoshka 表示學習支援 768 到 128 維的靈活維度,上下文視窗 8K,是純文字版 EmbeddingGemma 的 4 倍,並以 Apache 2.0 許可開放商用。

Hacker News front page10/3 10:13AI 評分58

Google 取消 Gemini Flash 與 Pro 模型免費使用

Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。

X @GoogleDeepMind● 精選10/6 17:04AI 評分73

@GoogleDeepMind: Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings.

Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。

Hacker News front page● 精選10/6 17:03AI 評分85

Google 發布 EmbeddingGemma 2,740M 引數開源端側多模態嵌入模型

Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。

Google DeepMind blog● 精選10/6 20:57AI 評分85

Google 發布 740M 引數開源多模態嵌入模型 EmbeddingGemma 2

Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,可把文字、程式碼、影像、音訊、影片對映到同一嵌入空間。它基於 Gemma 4 架構,可拆分出 270M 純文字、170M 視覺與 300M 音訊編碼器,並用 MRL 把輸出向量從 768 維截斷到 128 維,本地向量庫儲存最多省 6 倍。

llama.cpp releases● 精選10/5 17:58AI 評分82

llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援

llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。

X @GoogleDeepMind● 精選10/6 17:04AI 評分80

@GoogleDeepMind: At 740M parameters, it’s competitive across benchmarks – even outperforming some specialist models …

Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。

Latent Space● 精選10/1 07:45AI 評分92

Gemini 4 Argon 發布:輸出上限 1M token,限網路安全預覽

Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。

X @ollama● 精選10/6 22:32AI 評分65

@ollama: .@GoogleDeepMind EmbeddingGemma 2 is now available on Ollama.

Google DeepMind 的 EmbeddingGemma 2 已上線 Ollama,執行 ollama pull embeddinggemma-2 即可拉取。訊息由 Ollama 官方帳號在 10 月 6 日發布,官方稱該模型面向消費級裝置,並且是多模態模型。原文未披露模型體積、上下文長度與具體支援的模態等細節。

NVIDIA blog● 精選10/2 00:44AI 評分85

OpenAI 上線 GPT-6 Astra Ultrafast,基於 NVIDIA Blackwell

GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放,執行在 NVIDIA Blackwell GPU 上。官方稱其 token 生成速度最高可達 Astra Standard 模式的 8 倍,可縮短 coding agent 的編輯—測試—除錯迴圈,並減少工具呼叫之間的等待。開發者可通過 API 使用,訪問方式、價格與實現細節見 Ultrafast 指南。

llama.cpp releases● 精選10/7 11:43AI 評分68

llama.cpp SYCL 為 GLM MLA 預填充接入 MKL,pp8192 提速 2.99 倍

llama.cpp 的 SYCL 後端放行了 GLM-4.7 Flash 的 MLA 形狀走 MKL flash attention,此前該形狀因 K/V 寬度不一致、head dim 上限 512 被排程器拒絕,預填充只能回退到更慢的 TILE kernel。在 Intel Arc Pro B70 上,pp8192 從 432.80 提升到 1292.29 tok/s(2.99 倍,+198.6%),tg256 在噪聲範圍內基本不變(45.67 對 45.65)。

X @ollama10/6 22:32AI 評分42

@ollama: @GoogleDeepMind Model page:

Ollama 模型庫新增 Google DeepMind 的 embeddinggemma-2 頁面,地址為 ollama.com/library/embeddinggemma-2,使用者可通過 Ollama 拉取該嵌入模型。該條目由 Ollama 官方帳號發布,指向 Google DeepMind 的這一模型。原文未給出模型規模、上下文長度、許可證或效能資料等細節。

機器之心● 精選10/6 13:00AI 評分90

OpenAI 宣布 GPT-6 提速 50%,第三方實測訂閱額度只有 Claude 的 1/5

OpenAI 兌現 28 天連更承諾的第 1 天更新:GPT-6 Astra 與 GPT-6.1 Sol 預設速度提升約 50%,輸出從 30 TPS 提到 50 TPS,使用者無需操作、兩小時內生效,並覆蓋 OpenCode、Pi、Amp、Devin 等通過 Sign in with ChatGPT 接入的合作伙伴。

r/LocalLLaMA top of the day10/3 08:00AI 評分65

LiquidAI 發布 LFM2.5-Encoder 250M/350M 編碼器

LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。

Ollama releases● 精選10/6 16:08AI 評分76

Ollama v0.40.0-rc6 在 MLX 上加入多模態嵌入

Ollama 發布 v0.40.0-rc6,在 MLX runner 上實現 EmbeddingGemma2Model 架構,使本地嵌入支援多模態輸入。/api/embed 介面現在可通過 input dict 為每個條目單獨傳入媒體。該模型為 24 層雙向文字編碼器,帶 PLE,共享 gemma4 的視覺與音訊塔,輸出經 mean-pool 與 L2 歸一化。該標籤由 pdevine 於 10 月 6 日打上,對應提交 #18820,仍屬 rc 預發布版本。

X @GoogleDeepMind10/1 12:43AI 評分57

@GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…

Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放形式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時不拖慢關鍵研究進度。官方未披露具體工具名稱、技術細節與適用限制。

llama.cpp releases● 精選10/3 12:54AI 評分70

llama.cpp 的 OpenVINO 後端更新至 2026.4.1 並大幅最佳化 MoE 效能

ggml-openvino 後端更新到 2026.4.1,重點最佳化 Qwen3.5 MoE 推理效能,並新增推理效能分析、預設使用遠端輸出張量、磁碟快取模型直載(cache_only)等能力。在 Arc B390 上以 q4_asym64_all 重量化執行 gemma-4-26B-A4B,pp512 從 66.16 t/s 提升到 1608.73 t/s,tg128 從 25.94 提升到 26.46 t/s,困惑度基本不變。

r/LocalLLaMA top of the day10/3 05:10AI 評分40

使用者觀察新模型寫作趨向高資訊密度與生僻詞彙

有使用者在 Reddit 發帖指出,近期開源與閉源新模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和擴充套件詞彙,用更少字詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與追求 token 效率有關,但代價是普通讀者難以一眼讀懂,例如輸出中出現 Baudrillardian 這類需要背景知識才能理解的詞。

llama.cpp releases10/6 19:51AI 評分46

llama.cpp 修復 ggml CLAMP 非連續檢視定址錯誤

ggml 修復了 CLAMP 運算元在非連續檢視上的定址錯誤,涉及 CPU 與 CUDA 後端。CUDA 此前按 ggml_nelements 做平坦處理、忽略檢視 stride,CPU 則把第 j 行按 j*nb01 定址、忽略 nb02/nb03;現在兩者都改為遵循 dims 1..3 的 stride,且 CUDA 的 supports_op 要求行連續,與 Metal 一致。

r/ClaudeAI top of the day10/3 21:53AI 評分13

Reddit 使用者討論 Fable 5.5 下週發布預期

r/ClaudeAI 上有使用者提問,若 Fable 5.5 下週發布,效能會有多大提升。評論區普遍擔心 Anthropic 會削弱現有的 Opus 5.5,多人稱 Opus 5.5 是目前最好的 coding agent 體驗,希望保留現狀。也有使用者認為 Fable 定位是複雜編排與一次性完成大功能,價格是 Opus 的兩倍,若提升不夠明顯則難以說服人升級。

OpenAI News● 精選10/6 11:00AI 評分67

OpenAI 用 Ironclad 合同任務訓練 GPT-6 Astra

OpenAI 公布與 AI 合同平台 Ironclad 的研究合作,GPT-6 Astra 成為首個用 Ironclad 任務訓練的前沿模型。雙方與 Ironclad 使用者共同定義了 11 項法律、商務與採購任務,如搭建保密協議、採購審批流程和可複用條款,每項任務熟練使用者約需 30 到 40 分鐘,評估標準為 8 到 50 條。

Ollama releases● 精選10/6 19:47AI 評分82

Ollama v0.40.0:Apple Silicon 預設用 MLX 執行模型

Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8,其他可用模型還包括 gemma4、qwen3.6 和 qwen3.5;決策模型 Nimble、tev1、clef、clef-flash 也已支援 MLX,並新增嵌入模型 embeddinggemma-2 支援。官方表示會繼續測試並啟用更多模型。

Google Developers blog● 精選10/6 21:40AI 評分78

EmbeddingGemma 2 發布:740M 開源多模態嵌入模型

EmbeddingGemma 2 是一個 740M 引數的開源權重多模態模型,把文字、影像、影片與音訊對映到統一向量空間,面向隱私優先的端側檢索。開發者可用 MediaPipe Tasks 跨平台整合,或通過 LiteRT 在 CPU、GPU、NPU 上做細粒度效能最佳化。模型支援邊輸入邊搜的媒體檢索、影片關鍵幀定位與零樣本意圖路由等超低延遲本地場景。

llama.cpp releases10/4 11:42AI 評分50

llama.cpp 新增啟用統計與 GGUF imatrix 支援

llama.cpp 合併 PR #14891,為 GGUF 格式 imatrix 引入基於啟用值的統計計算,新增 --activation-statistics 引數。該功能可計算啟用熵、餘弦相似度、L2 範數及歐氏-餘弦分數(ECS),並支援外部 NextN 草稿檔案(-md / --model-draft)。預設不啟用啟用統計以避免 imatrix 體積翻倍,統計報告佈局與排序也按 imatrix 型別更新。

機器之心● 精選10/7 13:28AI 評分80

Google 發布 Nano Banana 2.1,底座換成 Gemini 3.6 Flash

Google DeepMind 正式發布 Nano Banana 2.1,底層由 Gemini 3.6 Flash 驅動,模型 ID 為 gemini-nano-banana-2.1,已作為穩定模型上線 Gemini App、AI Studio、Gemini API、Search AI Mode、Google Ads、Flow 與 Stitch。新版定位高效率影像生成與對話式編輯,支援 1K/2K/4K 輸出、最多 14 張參考圖融合,重點強化設計版式、蒙版區域性編輯和主體一致性;