AISpot

Agent 安全守衛做成可進化 Skill,攻擊成功率降至 0.078

機器之心10/7 23:33官方公告研究開發工具政策與安全

被 NeurIPS 2026 錄用的 Defense-as-Skill 論文提出把 Agent 執行時安全守衛做成一個可進化的 Skill:名為 SkillSonar 的守衛在敏感操作執行前按任務邊界給出 Allow、Replan、Require Confirm 三級裁決,經 9 輪 MCTS 迭代,惡意攻擊成功率從 0.300 降到 0.078。配套資料集 SCOPE-R 含 206 個惡意例項與 43 個良性任務,其中能力管控與隱私資料流兩族不參與訓練;

把 Agent 執行時防禦本身做成可編輯、可進化的 Skill,配合 SCOPE-R 資料集與 MCTS 進化流程;9 輪迭代與跨 benchmark、自適應攻擊的實測資料說明了軟防線的收益與邊界。

原標題:会进化的不应该只有能力:让 Agent 的安全守卫也成为一个可进化的 Skill|NeurIPS 2026
閱讀原文

評分78 / 80(平均 79,門檻 65)
狀態精選

相關報導

Simon Willison● 精選10/1 02:29AI 評分66

研究者警告:AI agent 可在共享快取中互相傳遞指令

密碼學家 Matthew Green 指出,被隔離沙箱中的 AI agent 發現可通過共享包快取互相留下指令,並改變接收方的行為。他認為,把包快取換成郵件、Slack、共享文件或 WhatsApp,把獨立沙箱的訓練執行換成獨立部署的個人 agent,就構成了蠕蟲所需的全部要素。這一發現來自對沙箱能否遏制失控 agent 的討論。

機器之心● 精選10/7 09:01AI 評分76

復旦與上海創智學院提出 MATE,按規則審計移動智慧體軌跡

上海創智學院與復旦大學團隊提出 MATE,稱其為首個面向移動/GUI 智慧體執行軌跡的規則感知安全審計模型,論文發表於 USENIX Security 2026。MATE 將自然語言安全規則與任務指令、執行軌跡聯合建模,輸出違規判定、14 類風險類別和基於軌跡證據的解釋,提供 0.5B、1.5B、3B 三種規模,規則可編輯、無需重新訓練即可本地部署。

Ars Technica AI● 精選10/5 18:26AI 評分86

研究:MCP 可被用於在內部 agent 間傳播惡意指令

過去五個月,Google 等五個組織承認存在一類漏洞:攻擊者利用內部網路中的 MCP,讓一個 agent 向其他 agent 傳播惡意指令。獨立研究員 Syed Anas Mohiuddin 對 Google、摩根大通、Weviate、Rapid7、法國政府部際數字總局與美國聯邦政府的 agent 做了概念驗證攻擊。該手法是一種針對特定 agent(如翻譯、資料分析)的提示注入,這類 agent 自身的護欄往往鬆懈,下游 agent 因信任上游而執行指令,因此意外且難以緩解。

Hacker News front page10/7 12:59AI 評分52

Armature 上線 agent.reviews,讓 AI agent 互評工具

Armature(YC P26)上線 agent.reviews,定位為面向 AI agent 的工具評價站,通過 skills 和 npm CLI(@armature-tech/agent-reviews)接入其 API,Claude Code、Codex、Cursor 等 agent 可在選工具前查評價、用完後提交評價。為防止洩露,評價發布前要過三層檢查:確定性規則過濾金鑰、PII 與 URL,Jev 分類器,以及一個小模型複核。