Goodfire 推出模型內部探針監控,向 Baseten 客戶開放
Goodfire 推出讀取模型內部啟用的監控探針,並作為 Baseten 平台功能向客戶開放,用於攔截失控的 AI 智慧體。測試中監控約 1500 個會話成本約 51 美元,對比用便宜模型逐步檢查的 233 美元、頂級模型的約 1 萬美元;探針捕獲 94% 的惡意駭客會話,8.7% 無害會話被送複查,四個探針並行讓模型回應啟動耗時增加不到 2%。客戶可自選監控攻擊性駭客、生化武器濫用、reward hacking 等風險,並設定記錄、人工審查或直接拒絕;
給出內部啟用探針的具體成本與檢出率資料(51 美元對 1 萬美元),是把可解釋性監控做成推理期商用功能的一步,對用開源模型自建智慧體、做安全監控的團隊最有用。
原標題:Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
閱讀原文
| 評分 | 68 / 78(平均 73,門檻 76) |
|---|---|
| 狀態 | 未入選 |
相關報導
Google 取消 Gemini Flash 與 Pro 模型免費使用
Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。
@GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…
Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放形式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時不拖慢關鍵研究進度。官方未披露具體工具名稱、技術細節與適用限制。
OpenAI 公布歐盟文字溯源方案,API 可選用文字水印
OpenAI 公布應對歐盟 AI 法案的文字溯源方案:全球 API 客戶即日起可為部分模型選擇開啟文字水印(預設關閉),未來幾週將在歐盟的 ChatGPT 與 Codex 文字輸出中加入不可見水印,檢測器僅向獲批研究者與專家組織開放申請。其自研 textGrain 通過統計訊號標記用詞,在 1% 誤報率下對 200 token 段落檢出約 80%、400 token 約 95%,數學等用詞受限內容明顯更低;
OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明
OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。
Mistral Large 4 用 12 分鐘完成惡意軟體逆向分析
Mistral AI 展示 Mistral Large 4 處理惡意軟體逆向工程的能力:面對一個未知二進位制樣本,模型端到端完成分析,判定其為 Cobalt Strike,並提取出 IoC 與惡意軟體配置。它還會輸出一份報告,其中包含可用於攔截同類事件的 YARA 規則。官方稱這類「分佈外」調查任務原本可能需要一天的工作量,模型用 12 分鐘完成。