南洋理工研究:Harness 選擇需與模型任務聯合評估
新加坡南洋理工大學安波團隊發布報告《Finding the Right Fit》,用 4 套可配置 Harness(OpenHands、DSH、PI、openJiuwen)交叉 5 個模型、3 個任務集,共得到 66 項結果。結論是 Harness 好壞並非固定屬性,同一模型換 Harness 後排名可能反轉,原生搭配也不一定最優;成本更高未必得分更好。
首次用 66 項交叉實驗量化模型與 Harness 的適配差異,並給出排名反轉、快取利用率等具體資料,對開發 Agent 應用、做選型評估的開發者有直接參考價值。
原標題:Agent Harness到底怎么选?南洋理工大学安波团队最新研究给出答案
閱讀原文
| 評分 | 68 / 78(平均 73,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
Hugging Face 發布多 harness RL 訓練指南
Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。
DeepSeek Harness 更新,加入 Claude Code Mods 相容層
DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。
DeepSeek 發布 Harness 桌面版,支援 macOS 與 Windows
DeepSeek 官方推出 DeepSeekHarness 的打包桌面版本,覆蓋 macOS 與 Windows 兩個平台。Linux 使用者可通過 npm 上的 @deepseek-ai/dsh 包獲取。官方在社交帳號上公布了這一訊息,並給出下載地址 deepseek.com/harness。
OpenRouter 發布 Model Router Benchmarks 對比頁
OpenRouter 於 2026 年 10 月 2 日上線 Model Router Benchmarks 頁面,用品質、速度、成本三個維度對多家模型路由器打分,並給出 0 到 10 的 Router Index 綜合分,預設權重為品質 60%、單任務耗時 20%、成本 20%,使用者可拖動滑塊調整。
使用者對比 Opus 5.5 與 Astra:Anthropic 半價促銷後轉投
一名理論物理博士生在 Anthropic 五折促銷下以 100 美元訂閱 20x 套餐,此前是 OpenAI 200 美元訂閱使用者。他用兩者分別製作 Minecraft 正義聯盟模組,稱 Astra 版本效果很差,而 Opus 5.5 的飛行動畫流暢、能力獲取方式更貼合遊戲程序與漫畫設定,平衡性和審美明顯更好,還一次性生成了論文所需圖表並妥善回覆審稿意見。