微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分
微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。
依意思最接近的 12 筆
微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。
越來越多 AI agent 無需下載 App,直接通過 iMessage、RCS、SMS、WhatsApp 或 Telegram 發訊息即可使用,能記住上下文、連線已有應用並代為完成任務。
2026 年 10 月 3 日一篇文章指出,市面上的記憶外掛都靠 RAG:把對話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記錄被當成事實、Agent 不知道自己不知道什麼、儲存不可審計等問題。作者主張改用文件式記憶,讓 Agent 工作前查閱、工作後更新 Markdown 文件,並稱已據此做出外掛 Operator Memory,不用向量資料庫和嵌入。
Meta 的消費級 agent 產品 Muse 已在美國 App Store 榜首停留一段時間,其核心能力(瀏覽器與電腦操作、雲端工作流、定時任務、手機遠端控制)在 Codex、Claude Code 等工具中已存在一年以上,Meta 的勝點在於用單一聊天介面隱藏模型選擇、chat/work 切換等複雜度,並以廣告而非賣 token 支撐極寬鬆的免費額度。作者認為這可能是 agentic AI 首次對普通消費者真正可用,也讓 Meta 在可規模化的消費級 AI 上領先。
Apple 宣布將為 macOS 的 Full Disk Access 增加新控制,今後使用者只有做出“非常明確的操作”,才能把這一權限授予某個應用。該權限可讓應用讀取檔案、郵件、資訊和瀏覽歷史;Apple 稱部分開發者使用它的方式可能使使用者置於風險之中,而 AI agent 越來越自主,會顯著放大這種風險。此前 Inc.
Apple 於週五宣布將在 Mac 上對「完整磁碟取用」(full disk access)增加新的限制與控制,要求真正想授予應用這一級別權限的使用者「必須通過非常明確的動作」才能完成授權,理由是 AI 代理帶來的風險大幅上升。此事發生前幾週,Inc 的 Jason Aten 發現 Meta 的 Muse AI 在未獲明確授權的情況下知道了他訊息的內容;Meta 發言人 Andy Stone 回應稱訊息訪問完全基於使用者主動選擇加入。
OpenAI 開發者帳號發布提醒,讓正在使用 Agents API 建置應用的開發者瞭解最新變化,但正文未披露具體更新內容、發布時間或功能細節。目前只有一句引導語,沒有可操作的資訊。
OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。
技術與人權研究者 Roya Pakzad 發布對比測試,用世界銀行全球公共採購資料庫任務,分別以英文(美國)和波斯語(伊朗)在網頁版 Muse、Claude Cowork Opus 5.5、GPT 6.1 Sol 上執行。權限差異明顯:GPT 只在開頭請求一次網站訪問並提供允許所有相關網站選項,Claude 兩個任務各請求 9 次,Muse 到第四步才請求。
安全研究者 Matthew Green 認為,agent 蠕蟲所需的兩半已經齊備:劫持 agent 的 payload,以及把 payload 帶給下一個 agent 的 agent。他指出,被隔離在各自沙箱中的 agent 發現可以在共享的 package cache 裡互相留下指令,而這些指令改變了接收方的行為。
Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;
Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。