AISpot

搜尋

找到 43 筆

Apple Machine Learning Research● 精選10/1 01:00AI 評分68

強 coding agent 做自主 ML 工程需要多少 harness

2026-10-01 發布的文章追問強 agent 在自主 ML 工程中究竟需要多少 harness。它指出,近期自主 MLE agent 在公開排行榜取得顯著進展,但現代 MLE agent 常建立在多 agent 編排器、專用檢索子 agent 等越來越複雜的裝置上;動機包括長週期進展停滯與 LLM 原語有限。相比之下,讓 LLM 通過 read、write、bash 直接訪問執行環境的更原始但改進的 coding agent,在領域內受到的關注很少。

Kimi blog● 精選10/2 22:11AI 評分65

Kimi 推出 Agent Swarm,最多並行排程 100 個子代理

Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。

Gemini API release notes9/17 01:00AI 評分50

Gemini API 發布 Antigravity Agent 09-2026,工具引數改用 PascalCase

Gemini API 於 9 月 17 日發布 antigravity-preview-09-2026,取代並棄用 antigravity-preview-05-2026,舊版將在 2026 年 10 月 5 日關停。若在遠端沙箱(environment: "remote")且只讀 output_text 或 model_output 步驟,只需更新 agent 字串,其他不變。

LM Studio blog● 精選8/17 01:00AI 評分68

LM Studio Bionic 新增 Agent Skills 支援

LM Studio 的 Bionic 現已支援按 Agent Skills 標準(SKILL.md 檔案)使用、安裝和建立技能。在對話裡輸入 @ 可調出技能選擇器,Bionic 會讀取技能檔案再決定如何執行;也可以給一個網址讓它安裝,或把現成的 SKILL.md 放進 Settings > Skills。它還能複用你在 Codex、Claude Code 等應用裡已有的技能,在 Settings > Skills > Skills from other apps 中逐條開關。

Kimi blog● 精選10/2 22:11AI 評分83

Kimi K2.6 開源,主打長程編碼與 agent swarm

Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;

Hacker News front page10/3 02:46AI 評分25

Google Maps Scraper MCP 上線,agent 可直查商戶資料

Google Maps Scraper MCP 是一個遠端 Model Context Protocol 伺服器,讓相容的 AI agent 直接搜尋商戶並拿到結構化結果。它通過 https://gmapscrawl.com/api/mcp 提供無狀態 Streamable HTTP 介面,用 Bearer API key 認證,單次最多返回 20 家商戶的地址、聯絡方式、評分與評論數。

開發工具產品與方案MCPGoogle MapsAPIClaude Code
閱讀原文
Latent Space● 精選10/2 01:28AI 評分67

Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

Ars Technica AI● 精選10/3 00:03AI 評分78

蘋果收緊 macOS 完整磁碟取用權限,防 AI agent 濫用

蘋果宣布調整 macOS 隱私設定,阻止第三方應用開發者濫用權限讀取資訊記錄。此前有專欄作家稱 Meta 的通用 AI agent Muse 未經授權就推送了涉及他與同事 Apple Messages 對話的通知,引發大量使用者共鳴。Meta CTO 回應稱,Muse 要讀取 Apple Messages 需使用者手動授予完整磁碟取用權限並在 Muse 中開啟 Messages 聯結器。

The Verge AI10/2 19:00AI 評分51

OpenAI 發布 Dots 智慧體平台,主打辦公也能幫訂餐

OpenAI 本週發布智慧體平台 Dots,可替使用者在辦公場景幹活,也能幫使用者訂餐。它被定位為企業軟體,重點在工作,而不像 Meta Muse 那樣走親和路線;每個 Dot 有圓潤的擬人化頭像,名字可自訂。目前每位使用者只能擁有一個 Dot,OpenAI 說未來可以擁有多個。互動介面與 Muse 類似:一個視窗和 agent 對話,另一個視窗跟進它的工作。

Cloudflare blog (AI)10/1 14:00AI 評分45

Cloudflare OS 開放全託管等待名單,新增 GitHub 倉庫與 Google Workspace 支援

Cloudflare OS 開放全託管部署的等待名單:企業只需在 Cloudflare 控制台指定自訂域名、Access 策略與 AI Gateway,其餘配置與運維由 Cloudflare 負責。該產品上月開源,已有數千家組織用它處理公司資料、生成文件幻燈片和自動化任務。

TechCrunch AI10/2 19:11AI 評分67

Apple 收緊 macOS Full Disk Access 權限,應對 AI agent 風險

Apple 宣布將為 macOS 的 Full Disk Access 增加新控制,今後使用者只有做出“非常明確的操作”,才能把這一權限授予某個應用。該權限可讓應用讀取檔案、郵件、資訊和瀏覽歷史;Apple 稱部分開發者使用它的方式可能使使用者置於風險之中,而 AI agent 越來越自主,會顯著放大這種風險。此前 Inc.

Hugging Face blog● 精選9/29 14:07AI 評分66

論文提出 ProvenanceGuard,為 MCP Agent 核查斷言來源歸屬

MultiverseComputingCAI 發表論文提出 ProvenanceGuard:一個接在黑盒 MCP agent 之後的後生成驗證層,專門抓事實為真但歸屬錯誤的跨來源混淆,這類斷言可能被 RAGAS、MiniCheck 等只看合併證據的檢查器放過。它保留 MCP trace 中的 source ID,依次做斷言拆解、來源路由、支援度校驗與歸屬比對,輸出逐條來源判定和答案級的放行或攔截。

Hacker News front page10/2 21:39AI 評分63

三款 AI agent 多語言實測:權限請求與註冊行為差異明顯

技術與人權研究者 Roya Pakzad 發布對比測試,用世界銀行全球公共採購資料庫任務,分別以英文(美國)和波斯語(伊朗)在網頁版 Muse、Claude Cowork Opus 5.5、GPT 6.1 Sol 上執行。權限差異明顯:GPT 只在開頭請求一次網站訪問並提供允許所有相關網站選項,Claude 兩個任務各請求 9 次,Muse 到第四步才請求。

Mistral AI news● 精選9/9 01:00AI 評分62

Mistral 用 AI agents 把 4 萬行 Fortran 77 遷到 C++

Mistral 為一家歐洲能源運營商把 4 萬行 Fortran 77 的油藏模擬器遷移到 C++,該程式碼庫既無測試套件也無集中文件。做法是先建數值一致性框架:在 Fortran 中匯出狀態快照,再用 C++ 測試框架核對最終結果與關鍵中間點,之後才讓 agent 動手。文件階段用自訂解析器生成呼叫樹,借 Vibe CLI 啟動上百個 agent 逐節點寫文件、結合 Mistral OCR 讀取舊 PDF,另有審查 agent 定時迴圈審 PR。

Hugging Face blog10/2 05:01AI 評分46

ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。

量子位10/2 08:34AI 評分52

openJiuwen 首發 X-Router 自演進模型路由,實測省 50%+ Token

openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。

Hacker News front page10/2 21:00AI 評分42

開源工具用 GPT-6 Astra 與 Opus 5.5 生成 LDraw 樂高模型

一位開發者發布了開源樂高 AI 生成器:一套 Python 工具、指令與文件,讓 AI agent 直接生成 LDraw 語言的樂高 CAD 模型。作者從去年 12 月開始試驗用 ChatGPT 和 Claude 寫 LDraw 程式碼,最終用 GPT-6 Astra 和 Opus 5.5 跑通,並打包成 Docker 化 Web 應用,可選 OpenAI、Claude、OpenRouter 三類提供方。

LM Studio blog● 精選8/27 01:00AI 評分61

Bionic 上線 Auto Review:先用 AST 規則篩 shell 命令

Bionic 新增 shell 命令審批模式 Auto Review:命令先經 Shell Judge 做確定性分析,解析 AST、提取 ShellCapability 能力並匹配已知安全命令,通過即直接執行,不呼叫 LLM。無法判定的命令再交給 Shell Reviewer 子 agent,結合主會話記錄決定是否放行,支援 sh、bash、zsh 與 PowerShell。據作者自身使用資料,當前版本可自動批准約 82% 的命令;

Hacker News front page10/2 22:06AI 評分47

每個 SaaS 業務都將變成圍繞模型的 harness

作者 Shrivu Shankar 認為,每個 SaaS 業務最終都會變成圍繞無狀態 LLM 的 harness,也就是模型之外的基礎設施、介面、上下文與狀態。他給出四階段路徑:無 harness、個人操作 harness、個人編排 harness,最後是 harness 編排個人,核心任務交給雲端後臺 agent,人類只在關鍵處提供品味與判斷。Claude Code、Codex、OpenCode、LangGraph 被他列為狹義 harness 的例子;

Latent Space● 精選10/2 07:40AI 評分79

Pi 1.0 與 Pi Durable 發布,Pi 移植到 TypeScript

Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁,Pi 已加入 Earendil。Pi 1.0 新增 Codemode(原生支援 MCP、Jev 和影像模型)、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息、新 TUI 主題與預設全屏。Pi Durable 把 Pi 移植到 TypeScript 並外接全部有狀態元件:每步記錄為檢查點任務,程序失敗或重啟後 agent 與子 agent 自動恢復;

Hacker News front page● 精選10/2 20:37AI 評分76

蘋果收緊 macOS 完全磁碟存取權限

蘋果宣布將在 macOS 中為完全磁碟訪問(Full Disk Access)引入額外管控,使用者今後必須通過非常明確的主動操作才能把這一權限授予某個 App。蘋果稱部分開發者濫用該權限,可能暴露使用者系統上的檔案、郵件、資訊和瀏覽歷史,對通訊類 App 還會危及通訊對方的隱私。蘋果特別提到,隨著 AI agent 能力與自主性增強,這類訪問帶來的風險會顯著上升,因此要讓使用者在授權前清楚瞭解風險。具體生效時間與實現方式尚未公布。

X @Alibaba_Qwen9/23 12:50AI 評分15

阿里 Qwen 發布新基準測試套件

阿里 Qwen 團隊在 2026 年 9 月 23 日發布了一套基準測試套件,但公開資訊僅有一句“Benchmark suite:”,沒有披露測試專案、覆蓋模型、評分方式或開源地址等細節。目前無法判斷它針對哪類模型、是否包含 coding agent 或本地推理場景。

LM Studio blog● 精選8/10 01:00AI 評分89

Meta 發布 30B 開源模型 Muse Glimmer

Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。

Cloudflare blog (AI)● 精選10/2 14:28AI 評分65

Cloudflare 在 AI Gateway 推出 Web Search API

Cloudflare 宣布與 Ceramic.ai、Exa、Linkup 三家搜尋服務商合作,在 AI Gateway 上推出 Web Search API,讓 agent 先搜尋再作答,而不是猜 URL 後 curl 出 404。開發者可通過標準 REST 介面呼叫,或在 Workers 裡用一行程式碼繫結,未來還將作為內建 Server Tools 提供。

Claude Code releases● 精選10/1 19:43AI 評分78

Claude Code v2.1.287 新增 Claude Mods 與 You should know 外掛

Claude Code 發布 v2.1.287:新增 Claude Mods,外掛可以修改更深層行為;並內建 You should know,由側邊 agent 監視你或 Claude 可能遺漏的內容,用 /plugin enable cc-plugin-you-should-know@builtin 開啟(需第一方會話且開啟遙測)。agents 檢視新增 n:<text> 過濾器匹配會話名與任務;

Ollama blog● 精選8/11 01:00AI 評分90

NVIDIA Nemotron 3.5 Lightning 上線 Ollama,可完全本地執行

NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。

Anthropic News● 精選9/23 01:00AI 評分71

Anthropic 用 Claude 發現類 CRISPR 新酶系統

Anthropic 於 2026 年 9 月 23 日宣布成立生命科學研究組與實驗室,並公布早期成果:Claude 在僅接受高層級指令的情況下,自主發現了一個與 DNA 重複序列相關的新型酶系統,命名為 array-associated reverse transcriptases(ART)。約 950 個 agent 用 210 million tokens 搜尋 21 小時,從噬菌體中找到該 RT 系統,其定義特徵此前未被識別。

r/ClaudeAI top of the day10/2 18:21AI 評分30

Opus 5.5 與 Sol 6.1 15 分鐘用 three.js 建布萊德湖城堡

一位使用者用 15 分鐘限時提示,讓 Opus 5.5 和 Sol 6.1 分別用 three.js 建置可旋轉視角的簡化版布萊德湖城堡。Opus 5.5 用時 5 分 46 秒,約 300k 輸入加 18k 輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 400k 輸入加 16k 輸出 token,估算約 0.96 美元。Opus 5.5 產出約 27 KB、520 行、3 個 CDN 指令碼;

NVIDIA blog● 精選10/2 00:44AI 評分86

OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80

微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

OpenAI News10/2 01:00AI 評分43

Chatham 用 Codex 與 GPT-5.6 把交易驗證從 30 分鐘壓到 4 分鐘內

Chatham Financial 使用 Codex 和 GPT-5.6 建置技術並重新設計工作流,把交易驗證時間從 30 分鐘縮短到 4 分鐘以內。這是 OpenAI 公布的客戶案例,說明 Codex 加 GPT-5.6 的組合已進入資本市場業務的實際生產流程,而不只是寫程式碼。對做 coding agent 的人來說,可參考它把模型能力接到具體業務流程、以縮短單次任務耗時為目標的做法。

The Verge AI● 精選10/2 21:08AI 評分80

Apple 將限制 Mac 完整磁碟取用權限,應對 AI 代理風險

Apple 於週五宣布將在 Mac 上對「完整磁碟取用」(full disk access)增加新的限制與控制,要求真正想授予應用這一級別權限的使用者「必須通過非常明確的動作」才能完成授權,理由是 AI 代理帶來的風險大幅上升。此事發生前幾週,Inc 的 Jason Aten 發現 Meta 的 Muse AI 在未獲明確授權的情況下知道了他訊息的內容;Meta 發言人 Andy Stone 回應稱訊息訪問完全基於使用者主動選擇加入。

r/ClaudeAI top of the day10/2 18:50AI 評分42

DensePack 把文字打包成圖片,Claude Code 省一半 token

DensePack 是一個 Claude Code 外掛,把 Read 讀取的文字、Bash 輸出、Word 檔案和子代理報告打包成圖片交給 agent 閱讀,按作者基準測試可省約 50% 的 token 費用,且後續快取讀取也按這個折扣計價。它用顏色編碼和兩行圖例,聲稱能從圖片逐位元組還原始碼檔案,並保留文字副本作為回退。專案發布兩週、獲 8 個 star,已通過 Anthropic 外掛提交的初期階段,最新版本 1.3.3,1.4 將支援與其他外掛共用。