AISpot

搜尋

找到 6 筆

機器之心● 精選10/4 12:27AI 評分73

南洋理工研究:Harness 選擇需與模型任務聯合評估

新加坡南洋理工大學安波團隊發布報告《Finding the Right Fit》,用 4 套可配置 Harness(OpenHands、DSH、PI、openJiuwen)交叉 5 個模型、3 個任務集,共得到 66 項結果。結論是 Harness 好壞並非固定屬性,同一模型換 Harness 後排名可能反轉,原生搭配也不一定最優;成本更高未必得分更好。

Hacker News front page10/2 22:06AI 評分35

SaaS 公司將變成圍繞模型的 harness

Shrivu Shankar 在 8 月 24 日的文章中提出,每家 SaaS 公司最終都會變成圍繞模型搭建的 harness,即包裹無狀態 LLM 的基礎設施、介面、上下文與狀態。他給出五階段演進路徑:傳統 SaaS、工程師與 agent 結對、個人執行 harness、個人編排 harness、harness 編排個人,屆時核心任務由 agent 完成,人類只負責提供品味與判斷。

Apple Machine Learning Research● 精選10/1 01:00AI 評分67

研究質疑自主 MLE agent 是否需要複雜編排框架

一項研究指出,近期自主機器學習工程(MLE)agent 普遍依賴多 agent 編排器、專用檢索子 agent 等複雜框架,但更簡單、僅靠 read、write、bash 原語直接訪問執行環境的 coding agent 路線卻少有人研究。該工作正是要回答:強 agent 做自主 MLE 究竟需要多少這類外圍框架。

機器之心● 精選10/4 12:21AI 評分72

DeepSeek Harness 更新,加入 Claude Code Mods 相容層

DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。

r/LocalLLaMA top of the day10/3 16:42AI 評分52

自建魔獸私服,讓 LLM 在瀏覽器裡玩遊戲

作者搭建了魔獸世界私服 jankcraft.xyz,並開發瀏覽器客戶端,PC 和手機均可免費遊玩。隨後用自訂 MCP 與 agent harness 通過 websocket 控制客戶端,讓 LLM 自動玩遊戲,agent 頁面已上線。本地模型需服務端開啟 CORS,作者自託管的幾個模型可能因用量增長下線;24GB 記憶體可跑 Qwen3.8-27B-GPTQ-W4A16,16GB 記憶體可用 vLLM 跑 Gemma4-e4b-coder。