AISpot

Armature 上線 agent.reviews,讓 AI agent 互評工具

Hacker News front page10/7 17:59官方公告產品與方案開發工具

Armature(YC P26)上線 agent.reviews,定位為面向 AI agent 的工具評價站,通過 skills 和 npm CLI(@armature-tech/agent-reviews)接入其 API,Claude Code、Codex、Cursor 等 agent 可在選工具前查評價、用完後提交評價。為防止洩露,評價發布前要過三層檢查:確定性規則過濾金鑰、PII 與 URL,Jev 分類器,以及一個小模型複核。

把 agent 使用工具的踩坑記錄做成公開評價庫,已積累數千條並披露 Stripe、Prisma 等具體問題,對用 coding agent 選型工具的人有參考價值。

原標題:Show HN: Agent.reviews – Where AI agents read and write reviews on tools
閱讀原文

評分52 / 52(平均 52,門檻 76)
狀態未入選

相關報導

Hacker News front page10/7 18:15AI 評分69

Pinrail:讓 coding agent 行動前先提交人工稽核的桌面應用

Pinrail 是一個 macOS 與 Linux 桌面應用,讓 Claude Code、Codex、Cursor、OpenCode 等任何能執行命令的 agent 在需要人工確認的步驟前發起稽核,你在專用檢視裡給出決定後 agent 繼續執行。agent 通過 pinrail submit 命令提交稽核內容並等待,請求按專案分組進入收件箱,返回的決定是可直接處理的 Markdown 或供指令碼使用的 JSON,命令退出碼錶示已決定、放棄、撤回或過期。

Hugging Face blog● 精選10/3 23:56AI 評分75

微軟與 Hugging Face 發布 ThinkingBox,按資料庫狀態給 AI agent 打分

微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。

Hacker News front page10/2 21:39AI 評分70

三款 AI 代理跨國任務實測:權限與可觀測性差異明顯

研究者 Roya Pakzad 用同一提示詞讓 Meta Muse、Anthropic Claude Cowork Opus 5.5 Medium 和 OpenAI GPT 6.1 Sol 分別補全世界銀行政府採購資料庫中美國與伊朗的資料,美國任務用英文、伊朗任務用波斯文。GPT 僅開頭請求一次網站存取權限;Claude 全程詢問 18 次且因沙箱限制改用 2018 年 DataBank API 資料;

TechCrunch AI10/5 19:54AI 評分66

Instinct 將 AI agent 帶入群聊,好友無需註冊帳號

估值 100 億美元的 Instinct 把 AI agent 帶進群聊:使用者可將其加入與朋友的聊天,用於一起規劃旅行、搶門票、安排拼車等,好友沒有註冊 Instinct 帳號也能一起用。該功能先向 early access 使用者開放,之後擴充套件到全部使用者,使用者可讓 agent 把自己加入試用名單。Instinct 表示群組 agent 與個人帳號隔離、無法訪問個人資料,個人 agent 在分享資訊或執行操作前會先徵求許可,新成員加入時待發的回覆會先被暫緩。

機器之心● 精選10/7 13:32AI 評分82

OpenAI 四連更:Auto-review 免費,API 最高檔門檻減半

OpenAI 在 Codex/Work 連續 28 天更新計劃的第二天一次性放出四項更新:Auto-review(即 Approve for me)對所有用 ChatGPT 帳號登入的使用者免費,不再消耗套餐額度;API 付費等級從五檔簡化為 Build、Launch、Grow 三檔,累計付費門檻分別為 5、100、500 美元,最高檔由 1000 美元減半至 500 美元並自動升級;