AISpot

7B 審計模型 AgentForesight 上線,多智慧體任務失敗前預警

機器之心新聞報導研究模型開源

羅格斯大學、得州大學奧斯汀分校與普渡大學團隊提出線上審計模型 AgentForesight,用 7B 模型在任務執行中逐步讀取軌跡字首,在關鍵錯誤擴散成失敗前報警。在 AFTraj-2K 測試集上,其關鍵錯誤步驟識別 Exact-F1 達 66.44,比最強通用基線 DeepSeek-V4-Pro 高 19.88 分,成功軌跡誤報率僅 2.37%。

把多智慧體失敗歸因從事後前移為線上審計:7B 模型在錯誤被下游沿用前報警,Exact-F1 66.44、誤報率 2.37%,且開原始碼與資料集,對做多 Agent 可靠性評估的人有直接參考價值。

原標題:NeurIPS 2026 | 别等Agent把任务搞砸!7B审计员AgentForesight在线抓错
閱讀原文

評分80 / 77(平均 78,門檻 65)
狀態精選

相關報導

機器之心● 精選AI 評分72

SAGE:用結構訊號糾偏長推理,AC 例項驗證通過率近 8 倍

維吉尼亞理工、威斯康辛大學麥迪遜分校與達特茅斯學院團隊在 NeurIPS 2026 提出 SAGE,用結構訊號引導長程推理的後訓練。方法以符號閉包分析(SCA)解釋探索偏差與累積偏差,訓練時用代數稀疏化和雙曲結構引導重排候選推理步,在 12 個基準、7 個模型家族上總體優於 SFT、GRPO、EMPO 與 GRPO-PRM。在 1,190 個 Andrews–Curtis 長程例項上,Qwen3 的 Lean 驗證通過率接近基礎模型的 8 倍;

Hacker News front pageAI 評分56

為什麼 coding agent 依然很笨:模型在進步,agent 卻拖後腿

一位開發者認為 AI 程式設計的瓶頸是 agent 而不是模型:模型生成程式碼的能力持續提升,agent 卻停在原地。他區分了模型(GPT Astra、Claude Sonnet、GLM-5.3)與 agent(Claude Code、Codex),並列舉四類問題:OpenCode 把約 1.5k 行的改動拆成 10 個子任務卻逐個序列執行;agent 不會按任務難度切換更便宜或更強的模型;Claude Code 說不清自身功能,只能聯網搜尋;Plan 模式產出的計劃零散、難讀。

機器之心AI 評分62

白澤通境發布溯因式世界模型 AWM,2bit 量化跑進機器人端側

中科大系公司白澤通境發布溯因式世界模型 AWM,並開源論文與程式碼,配合自研端側推理引擎 BAIZ-RUN 把模型壓進機器人本地執行。AWM 從無標註影片學習,在 Push-T 任務上以 2000 條軌跡達到 75% 成功率,約為 Causal-JEPA 所需資料的七分之一,資料加到 14728 條時成功率約 92%。

Hugging Face blog● 精選AI 評分78

用 ML Intern 幾天做出 6 個模型,9B 改寫器壓到 0.8B

Hugging Face 的 yuvraj sharma 用 HuggingChat 裡的 ML Intern agent,幾天內做出 6 個公開模型,其中把 Qwen-Image 2.1 自帶的 9B 提示改寫器蒸餾成 0.8B 版本,可在 CPU 執行,輸出有效率 99.7%,token 消耗約為教師模型的四分之一。該專案含 9B 模型標註 8,797 條樣本,算力成本 16 美元。

Hugging Face blog● 精選AI 評分75

微軟與 Hugging Face 發布 ThinkingBox,按資料庫狀態給 AI agent 打分

微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。