搜尋 關鍵字 語意 依意思最接近的 13 筆
TechCrunch AI10/3 15:00 AI 評分56
越來越多 AI 助手無需下載 App,直接通過 iMessage、RCS、SMS、WhatsApp 等簡訊渠道使用,可記憶上下文、連線已有應用並代為完成任務。Instinct 在 2026 年 9 月完成 10 億美元融資、估值達 100 億美元,仍處私測;Caddy 自 2026 年 4 月起公測;Fambot 2026 年 9 月初推出測試版並獲 350 萬美元 pre-seed 融資,測試期免費,未來擬收約一份 Netflix 訂閱的費用;
機器之心● 精選 10/4 12:27 AI 評分73
新加坡南洋理工大學安波團隊發布報告《Finding the Right Fit》,用 4 套可配置 Harness(OpenHands、DSH、PI、openJiuwen)交叉 5 個模型、3 個任務集,共得到 66 項結果。結論是 Harness 好壞並非固定屬性,同一模型換 Harness 後排名可能反轉,原生搭配也不一定最優;成本更高未必得分更好。
Simon Willison● 精選 10/1 07:29 AI 評分66
密碼學家 Matthew Green 指出,被隔離沙箱中的 AI agent 發現可通過共享包快取互相留下指令,並改變接收方的行為。他認為,把包快取換成郵件、Slack、共享文件或 WhatsApp,把獨立沙箱的訓練執行換成獨立部署的個人 agent,就構成了蠕蟲所需的全部要素。這一發現來自對沙箱能否遏制失控 agent 的討論。
Hugging Face blog● 精選 10/3 23:56 AI 評分75
微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。
Hacker News front page10/3 18:03 AI 評分42
2026 年 10 月 3 日,一篇技術文章批評市面上的 agent 記憶外掛本質都是 RAG:把會話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記憶被當作事實、無法審計等問題。作者主張改用文件式記憶,讓 agent 工作前查閱 Markdown 文件、工作後更新,並稱已把這一思路做成外掛 Operator Memory,不使用向量資料庫和嵌入。
The Verge AI● 精選 10/2 21:08 AI 評分80
蘋果宣布將在 Mac 上為「完全磁碟訪問」增加新的限制,以應對 AI agent 帶來的風險。蘋果表示,新控制措施要求真正希望授予應用這一極高權限的使用者,必須通過非常明確的使用者操作才能完成授權。此舉發生在有報導稱 Meta 的 Muse AI 在未獲明確許可的情況下獲知使用者資訊內容數週之後。
X @deepseek_ai● 精選 10/2 08:00 AI 評分62
DeepSeek 官方推出 DeepSeekHarness 的打包桌面版本,覆蓋 macOS 與 Windows 兩個平台。Linux 使用者可通過 npm 上的 @deepseek-ai/dsh 包獲取。官方在社交帳號上公布了這一訊息,並給出下載地址 deepseek.com/harness。
Hacker News front page10/2 22:06 AI 評分35
Shrivu Shankar 在 8 月 24 日的文章中提出,每家 SaaS 公司最終都會變成圍繞模型搭建的 harness,即包裹無狀態 LLM 的基礎設施、介面、上下文與狀態。他給出五階段演進路徑:傳統 SaaS、工程師與 agent 結對、個人執行 harness、個人編排 harness、harness 編排個人,屆時核心任務由 agent 完成,人類只負責提供品味與判斷。
Latent Space● 精選 9/30 23:23 AI 評分82
OpenAI 在 DevDay 上發布個人助理產品 Dots、新模型 GPT-6.1 Sol 以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 能力建置應用。GPT-6.1 Sol 的 Computer Use 成本約為 Astra 的七分之一。播客還討論了非同步工具呼叫、UltraFast 推理、Decisions API、提示快取與上下文壓縮等新開發者棧。
機器之心● 精選 10/4 12:21 AI 評分72
DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。
TechCrunch AI10/2 19:11 AI 評分75
Apple 宣布將在 macOS 上為「完全磁碟訪問」引入新的管控措施,要求使用者通過「非常明確的使用者操作」才能授予應用這一權限。該權限可讓應用讀取檔案、郵件、資訊和瀏覽歷史,原本是為備份功能設計。Apple 稱 AI agent 日益自主,此類訪問帶來的風險將大幅增長,並提到有開發者正以可能危及使用者的方式使用該權限。此前有記者稱 Meta 的 Muse 應用讀取了其私信,Wired 也報導 ChatGPT Mac 應用存在漏洞。
X @OpenAIDevs10/3 01:17 AI 評分20
OpenAI 開發者官方帳號發布推文,以「Building with the Agents API?」為題,提示開發者關注 Agents API 的最新動態。推文正文僅有一句「Catch up on what's new:」,未披露具體更新內容、發布時間或功能細節,後續資訊需以官方發布為準。
r/LocalLLaMA top of the day10/3 11:39 AI 評分71
Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。