AISpot

搜尋

依意思最接近的 12 筆

Hacker News front page10/3 18:03AI 評分55

觀點:Agent 不需要記憶,需要文件

2026 年 10 月 3 日一篇文章指出,市面上的記憶外掛都靠 RAG:把對話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記錄被當成事實、Agent 不知道自己不知道什麼、儲存不可審計等問題。作者主張改用文件式記憶,讓 Agent 工作前查閱、工作後更新 Markdown 文件,並稱已據此做出外掛 Operator Memory,不用向量資料庫和嵌入。

Hugging Face blog10/3 23:56AI 評分55

微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

Latent Space● 精選10/2 01:28AI 評分67

Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

The Verge AI● 精選10/2 21:08AI 評分80

Apple 將限制 Mac 完整磁碟取用權限,應對 AI 代理風險

Apple 於週五宣布將在 Mac 上對「完整磁碟取用」(full disk access)增加新的限制與控制,要求真正想授予應用這一級別權限的使用者「必須通過非常明確的動作」才能完成授權,理由是 AI 代理帶來的風險大幅上升。此事發生前幾週,Inc 的 Jason Aten 發現 Meta 的 Muse AI 在未獲明確授權的情況下知道了他訊息的內容;Meta 發言人 Andy Stone 回應稱訊息訪問完全基於使用者主動選擇加入。

TechCrunch AI10/2 19:11AI 評分67

Apple 收緊 macOS Full Disk Access 權限,應對 AI agent 風險

Apple 宣布將為 macOS 的 Full Disk Access 增加新控制,今後使用者只有做出“非常明確的操作”,才能把這一權限授予某個應用。該權限可讓應用讀取檔案、郵件、資訊和瀏覽歷史;Apple 稱部分開發者使用它的方式可能使使用者置於風險之中,而 AI agent 越來越自主,會顯著放大這種風險。此前 Inc.

r/LocalLLaMA top of the day10/2 18:47AI 評分65

Percepta 發布 Spotlight 架構:記憶無限增長且訪問成本不變

Percepta 發布新架構 Spotlight,用可寫記憶取代注意力,是首個在不增加訪問成本的前提下實現記憶無限增長的架構。每個 token 讀寫無界記憶,但模型學會索引單個記憶單元,因此每次只觸及少量單元;無論記憶如何增長,觸及單元數不變,稀疏度可任意調節。該架構把負責計算的情報模組與儲存知識、流程和工作狀態的記憶分離,記憶增長時情報模組大小與權重都不變。模型可自己決定逐 token 載入和覆蓋哪些記憶,記憶既能存事實也能存技能,因此不必重訓練就能獲得新能力。

Hacker News front page10/2 21:39AI 評分63

三款 AI agent 多語言實測:權限請求與註冊行為差異明顯

技術與人權研究者 Roya Pakzad 發布對比測試,用世界銀行全球公共採購資料庫任務,分別以英文(美國)和波斯語(伊朗)在網頁版 Muse、Claude Cowork Opus 5.5、GPT 6.1 Sol 上執行。權限差異明顯:GPT 只在開頭請求一次網站訪問並提供允許所有相關網站選項,Claude 兩個任務各請求 9 次,Muse 到第四步才請求。

Latent Space● 精選9/30 23:23AI 評分81

OpenAI DevDay 發布 GPT-6.1 Sol、Dots 與 Agents API

OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。

Hacker News front page10/3 19:23AI 評分35

Meta Muse 靠設計與廣告模式登頂美區 App Store

Meta 的消費級 agent 產品 Muse 已在美國 App Store 榜首停留一段時間,其核心能力(瀏覽器與電腦操作、雲端工作流、定時任務、手機遠端控制)在 Codex、Claude Code 等工具中已存在一年以上,Meta 的勝點在於用單一聊天介面隱藏模型選擇、chat/work 切換等複雜度,並以廣告而非賣 token 支撐極寬鬆的免費額度。作者認為這可能是 agentic AI 首次對普通消費者真正可用,也讓 Meta 在可規模化的消費級 AI 上領先。