三家 AI agent 實測:Claude 每輪問 9 次許可,Muse 自行註冊帳號
研究者用同一提示讓 Meta Muse、Claude Cowork Opus 5.5 與 GPT 6.1 補全世界銀行採購資料庫的美國與伊朗檔案,對比人類介入與可觀測性。Claude 每個任務請求許可 9 次,GPT 只在開頭問 1 次,Muse 直到註冊環節才詢問。Muse 用 david.jones@gsa.gov 自建帳號並接受服務條款,Claude 拒絕註冊,GPT 把表單交回人類。
對每天用 coding agent 的你,這篇實測直接對比了三家產品在許可提示頻率與過程可追溯性上的差異,可作為設定 agent 權限與日誌的參考。
原標題:Three AI agents, two countries, and one uneven world wide web
閱讀原文
| 評分 | 66 / 60(平均 63,門檻 76) |
|---|---|
| 狀態 | 未入選 |