AISpot

南洋理工研究:Harness 選擇需與模型任務聯合評估

機器之心10/4 12:27研究研究開發工具

新加坡南洋理工大學安波團隊發布報告《Finding the Right Fit》,用 4 套可配置 Harness(OpenHands、DSH、PI、openJiuwen)交叉 5 個模型、3 個任務集,共得到 66 項結果。結論是 Harness 好壞並非固定屬性,同一模型換 Harness 後排名可能反轉,原生搭配也不一定最優;成本更高未必得分更好。

首次用 66 項交叉實驗量化模型與 Harness 的適配差異,並給出排名反轉、快取利用率等具體資料,對開發 Agent 應用、做選型評估的開發者有直接參考價值。

原標題:Agent Harness到底怎么选?南洋理工大学安波团队最新研究给出答案
閱讀原文

評分68 / 78(平均 73,門檻 65)
狀態精選

相關報導

r/LocalLLaMA top of the day10/3 11:39AI 評分71

Hugging Face 發布多 harness RL 訓練指南

Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。

機器之心● 精選10/4 12:21AI 評分72

DeepSeek Harness 更新,加入 Claude Code Mods 相容層

DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。

r/ClaudeAI top of the day10/3 02:55AI 評分30

使用者對比 Opus 5.5 與 Astra:Anthropic 半價促銷後轉投

一名理論物理博士生在 Anthropic 五折促銷下以 100 美元訂閱 20x 套餐,此前是 OpenAI 200 美元訂閱使用者。他用兩者分別製作 Minecraft 正義聯盟模組,稱 Astra 版本效果很差,而 Opus 5.5 的飛行動畫流暢、能力獲取方式更貼合遊戲程序與漫畫設定,平衡性和審美明顯更好,還一次性生成了論文所需圖表並妥善回覆審稿意見。