AISpot

搜尋

找到 31 筆

Apple Machine Learning Research● 精選10/1 01:00AI 評分68

強 coding agent 做自主 ML 工程需要多少 harness

2026-10-01 發布的文章追問強 agent 在自主 ML 工程中究竟需要多少 harness。它指出,近期自主 MLE agent 在公開排行榜取得顯著進展,但現代 MLE agent 常建立在多 agent 編排器、專用檢索子 agent 等越來越複雜的裝置上;動機包括長週期進展停滯與 LLM 原語有限。相比之下,讓 LLM 通過 read、write、bash 直接訪問執行環境的更原始但改進的 coding agent,在領域內受到的關注很少。

Kimi blog● 精選10/2 22:11AI 評分65

Kimi 推出 Agent Swarm,最多並行排程 100 個子代理

Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。

Gemini API release notes9/17 01:00AI 評分50

Gemini API 發布 Antigravity Agent 09-2026,工具引數改用 PascalCase

Gemini API 於 9 月 17 日發布 antigravity-preview-09-2026,取代並棄用 antigravity-preview-05-2026,舊版將在 2026 年 10 月 5 日關停。若在遠端沙箱(environment: "remote")且只讀 output_text 或 model_output 步驟,只需更新 agent 字串,其他不變。

LM Studio blog● 精選8/17 01:00AI 評分68

LM Studio Bionic 新增 Agent Skills 支援

LM Studio 的 Bionic 現已支援按 Agent Skills 標準(SKILL.md 檔案)使用、安裝和建立技能。在對話裡輸入 @ 可調出技能選擇器,Bionic 會讀取技能檔案再決定如何執行;也可以給一個網址讓它安裝,或把現成的 SKILL.md 放進 Settings > Skills。它還能複用你在 Codex、Claude Code 等應用裡已有的技能,在 Settings > Skills > Skills from other apps 中逐條開關。

Ars Technica AI10/3 00:03AI 評分66

Apple 收緊 macOS 全盤存取權限,遏制 AI agent 濫用

Apple 宣布修改 macOS 隱私設定,阻止第三方應用開發者濫用這些設定來讀取訊息歷史。兩週前專欄作家 Jason Aten 稱,Meta 的通用 AI agent Muse 向他發了未經請求的通知,引用了他與同事在 Apple Messages 中的對話,而他從未授權 Muse 讀取訊息。

Kimi blog● 精選10/2 22:11AI 評分83

Kimi K2.6 開源,主打長程編碼與 agent swarm

Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;

Latent Space● 精選10/2 01:28AI 評分67

Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

The Verge AI10/2 19:00AI 評分51

OpenAI 發布 Dots 智慧體平台,主打辦公也能幫訂餐

OpenAI 本週發布智慧體平台 Dots,可替使用者在辦公場景幹活,也能幫使用者訂餐。它被定位為企業軟體,重點在工作,而不像 Meta Muse 那樣走親和路線;每個 Dot 有圓潤的擬人化頭像,名字可自定義。目前每位使用者只能擁有一個 Dot,OpenAI 說未來可以擁有多個。互動介面與 Muse 類似:一個視窗和 agent 對話,另一個視窗跟進它的工作。

Cloudflare blog (AI)10/1 14:00AI 評分45

Cloudflare OS 開放全託管等待名單,新增 GitHub 倉庫與 Google Workspace 支援

Cloudflare OS 開放全託管部署的等待名單:企業只需在 Cloudflare 控制台指定自定義域名、Access 策略與 AI Gateway,其餘配置與運維由 Cloudflare 負責。該產品上月開源,已有數千家組織用它處理公司資料、生成文件幻燈片和自動化任務。

TechCrunch AI10/2 19:11AI 評分67

Apple 收緊 macOS Full Disk Access 權限,應對 AI agent 風險

Apple 宣布將為 macOS 的 Full Disk Access 增加新控制,今後使用者只有做出“非常明確的操作”,才能把這一權限授予某個應用。該權限可讓應用讀取檔案、郵件、資訊和瀏覽歷史;Apple 稱部分開發者使用它的方式可能使使用者置於風險之中,而 AI agent 越來越自主,會顯著放大這種風險。此前 Inc.

Hugging Face blog● 精選9/29 14:07AI 評分66

論文提出 ProvenanceGuard,為 MCP Agent 核查斷言來源歸屬

MultiverseComputingCAI 發表論文提出 ProvenanceGuard:一個接在黑盒 MCP agent 之後的後生成驗證層,專門抓事實為真但歸屬錯誤的跨來源混淆,這類斷言可能被 RAGAS、MiniCheck 等只看合併證據的檢查器放過。它保留 MCP trace 中的 source ID,依次做斷言拆解、來源路由、支援度校驗與歸屬比對,輸出逐條來源判定和答案級的放行或攔截。

Hacker News front page10/2 21:39AI 評分63

三款 AI agent 多語言實測:權限請求與註冊行為差異明顯

技術與人權研究者 Roya Pakzad 發布對比測試,用世界銀行全球公共採購資料庫任務,分別以英文(美國)和波斯語(伊朗)在網頁版 Muse、Claude Cowork Opus 5.5、GPT 6.1 Sol 上執行。權限差異明顯:GPT 只在開頭請求一次網站訪問並提供允許所有相關網站選項,Claude 兩個任務各請求 9 次,Muse 到第四步才請求。

Mistral AI news● 精選9/9 01:00AI 評分62

Mistral 用 AI agents 把 4 萬行 Fortran 77 遷到 C++

Mistral 為一家歐洲能源運營商把 4 萬行 Fortran 77 的油藏模擬器遷移到 C++,該程式碼庫既無測試套件也無集中文件。做法是先建數值一致性框架:在 Fortran 中匯出狀態快照,再用 C++ 測試框架核對最終結果與關鍵中間點,之後才讓 agent 動手。文件階段用自定義解析器生成呼叫樹,借 Vibe CLI 啟動上百個 agent 逐節點寫文件、結合 Mistral OCR 讀取舊 PDF,另有審查 agent 定時迴圈審 PR。

Hugging Face blog10/2 05:01AI 評分46

ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。

量子位10/2 08:34AI 評分52

openJiuwen 首發 X-Router 自演進模型路由,實測省 50%+ Token

openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業構建,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。

Hacker News front page10/2 21:00AI 評分42

開源工具用 GPT-6 Astra 與 Opus 5.5 生成 LDraw 樂高模型

一位開發者發布了開源樂高 AI 生成器:一套 Python 工具、指令與文件,讓 AI agent 直接生成 LDraw 語言的樂高 CAD 模型。作者從去年 12 月開始試驗用 ChatGPT 和 Claude 寫 LDraw 程式碼,最終用 GPT-6 Astra 和 Opus 5.5 跑通,並打包成 Docker 化 Web 應用,可選 OpenAI、Claude、OpenRouter 三類提供方。

LM Studio blog● 精選8/27 01:00AI 評分61

Bionic 上線 Auto Review:先用 AST 規則篩 shell 命令

Bionic 新增 shell 命令審批模式 Auto Review:命令先經 Shell Judge 做確定性分析,解析 AST、提取 ShellCapability 能力並匹配已知安全命令,通過即直接執行,不呼叫 LLM。無法判定的命令再交給 Shell Reviewer 子 agent,結合主會話記錄決定是否放行,支援 sh、bash、zsh 與 PowerShell。據作者自身使用資料,當前版本可自動批准約 82% 的命令;

Hacker News front page10/2 22:06AI 評分47

每個 SaaS 業務都將變成圍繞模型的 harness

作者 Shrivu Shankar 認為,每個 SaaS 業務最終都會變成圍繞無狀態 LLM 的 harness,也就是模型之外的基礎設施、介面、上下文與狀態。他給出四階段路徑:無 harness、個人操作 harness、個人編排 harness,最後是 harness 編排個人,核心任務交給雲端後臺 agent,人類只在關鍵處提供品味與判斷。Claude Code、Codex、OpenCode、LangGraph 被他列為狹義 harness 的例子;

Latent Space● 精選10/2 07:40AI 評分79

Pi 1.0 與 Pi Durable 發布,Pi 移植到 TypeScript

Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁,Pi 已加入 Earendil。Pi 1.0 新增 Codemode(原生支援 MCP、Jev 和影像模型)、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息、新 TUI 主題與預設全屏。Pi Durable 把 Pi 移植到 TypeScript 並外接全部有狀態元件:每步記錄為檢查點任務,程序失敗或重啟後 agent 與子 agent 自動恢復;

LM Studio blog● 精選8/10 01:00AI 評分89

Meta 發布 30B 開源模型 Muse Glimmer

Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。

Cloudflare blog (AI)● 精選10/2 14:28AI 評分65

Cloudflare 在 AI Gateway 推出 Web Search API

Cloudflare 宣布與 Ceramic.ai、Exa、Linkup 三家搜尋服務商合作,在 AI Gateway 上推出 Web Search API,讓 agent 先搜尋再作答,而不是猜 URL 後 curl 出 404。開發者可通過標準 REST 介面呼叫,或在 Workers 裡用一行程式碼繫結,未來還將作為內建 Server Tools 提供。

Claude Code releases● 精選10/1 19:43AI 評分78

Claude Code v2.1.287 新增 Claude Mods 與 You should know 外掛

Claude Code 發布 v2.1.287:新增 Claude Mods,外掛可以修改更深層行為;並內建 You should know,由側邊 agent 監視你或 Claude 可能遺漏的內容,用 /plugin enable cc-plugin-you-should-know@builtin 開啟(需第一方會話且開啟遙測)。agents 檢視新增 n:<text> 過濾器匹配會話名與任務;

Ollama blog● 精選8/11 01:00AI 評分90

NVIDIA Nemotron 3.5 Lightning 上線 Ollama,可完全本地執行

NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。

Anthropic News● 精選9/23 01:00AI 評分71

Anthropic 用 Claude 發現類 CRISPR 新酶系統

Anthropic 於 2026 年 9 月 23 日宣布成立生命科學研究組與實驗室,並公布早期成果:Claude 在僅接受高層級指令的情況下,自主發現了一個與 DNA 重複序列相關的新型酶系統,命名為 array-associated reverse transcriptases(ART)。約 950 個 agent 用 210 million tokens 搜尋 21 小時,從噬菌體中找到該 RT 系統,其定義特徵此前未被識別。

NVIDIA blog● 精選10/2 00:44AI 評分86

OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80

微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

OpenAI News10/2 01:00AI 評分43

Chatham 用 Codex 與 GPT-5.6 把交易驗證從 30 分鐘壓到 4 分鐘內

Chatham Financial 使用 Codex 和 GPT-5.6 構建技術並重新設計工作流,把交易驗證時間從 30 分鐘縮短到 4 分鐘以內。這是 OpenAI 公布的客戶案例,說明 Codex 加 GPT-5.6 的組合已進入資本市場業務的實際生產流程,而不只是寫程式碼。對做 coding agent 的人來說,可參考它把模型能力接到具體業務流程、以縮短單次任務耗時為目標的做法。

The Verge AI● 精選10/2 21:08AI 評分80

Apple 將限制 Mac 全盤存取權限,應對 AI 代理風險

Apple 於週五宣布將在 Mac 上對「全盤訪問」(full disk access)增加新的限制與控制,要求真正想授予應用這一級別權限的使用者「必須通過非常明確的動作」才能完成授權,理由是 AI 代理帶來的風險大幅上升。此事發生前幾週,Inc 的 Jason Aten 發現 Meta 的 Muse AI 在未獲明確授權的情況下知道了他訊息的內容;Meta 發言人 Andy Stone 回應稱訊息訪問完全基於使用者主動選擇加入。