AISpot

搜尋

依意思最接近的 30 筆

TechCrunch AIAI 評分66

Instinct 將 AI agent 帶入群聊,好友無需註冊帳號

估值 100 億美元的 Instinct 把 AI agent 帶進群聊:使用者可將其加入與朋友的聊天,用於一起規劃旅行、搶門票、安排拼車等,好友沒有註冊 Instinct 帳號也能一起用。該功能先向 early access 使用者開放,之後擴充套件到全部使用者,使用者可讓 agent 把自己加入試用名單。Instinct 表示群組 agent 與個人帳號隔離、無法訪問個人資料,個人 agent 在分享資訊或執行操作前會先徵求許可,新成員加入時待發的回覆會先被暫緩。

Hacker News front pageAI 評分63

Veda 發布:把 AI agent 做進系統層、全棧 Rust 自研的作業系統

Veda 是一個把 AI agent 做進系統層的作業系統,從 UEFI 引導、微核心、驅動到視窗系統與應用全部用 Rust 從零編寫,目前支援 x86-64 PC 與 QEMU。agent 作為系統服務隨開機啟動,可用語音、點選工作列圓環或 Super+Space 喚醒,通過 agentapp 協議原生呼叫應用提供的 70 多個動作,不需要讀屏或模擬點選。

量子位● 精選AI 評分72

MirroS 發布 AgentGarten:程式碼建世界加 30fps 神經渲染,智慧體數輪學會捉迷藏

MirroS 團隊發布 AgentGarten,把可執行程式碼環境與即時神經渲染器接成閉環:物理規則由程式碼裁定,畫面由模型以 480p、30fps 以上流式逐塊生成,智慧體因此能邊行動邊看結果。重做的捉迷藏實驗中,躲藏者第 4 輪學會搬擋板搭掩體、搜尋者第 10 輪學會借坡道翻牆,而 OpenAI 2019 年的自我博弈強化學習分別用了約 2500 萬局和 1 億局。智慧體靠每輪復盤寫下文字「實驗手冊」傳給下一輪,另在陪伴小狗、狹橋會車、合作牧羊、採石場裝載機四個任務中各跑四輪;程式碼已在 GitHub 開源。

TechCrunch AIAI 評分57

研究者發現一支中國 AI agent fleet,疑執行於騰訊、呼叫高德地圖

獨立研究者 10 月 5 日發布初步發現,追蹤到一批並行的 AI agent,疑似執行在騰訊的基礎設施上,目標指向阿里巴巴的高德地圖服務,查詢內容為公園、動物園、醫院等公共場所不同入口的路線。研究者拒絕使用 swarm 一詞,稱應叫 agent fleet:多個 agent 執行同類任務,彼此之間沒有通訊跡象。這些活動是通過監控域名掃描服務 URLquery 的流量發現的,該服務常被 agent 用來載入無法直接訪問的網站並留下記錄;研究仍在進行中。

Hacker News front page● 精選AI 評分81

Prime Agent 用 Rust 重寫上線,2000 個 agent 自主完成

Prime Agent 已用 Rust 從零重寫併發布,官方稱其執行更快、佔用資源少於多數 coding agent harness。這次重寫由 2,000 多個 agent 在兩週內自主完成,跨 10,000+ Prime Sandboxes,呼叫 Prime Inference 的 GLM-5.3 端點消耗超 2,000 億 token。自 8 月上線以來 Prime Agent 下載量超 30 萬次、處理超 8 萬億 token;

Hacker News front pageAI 評分75

Docker 發布 docker-agent,用 YAML 定義並執行 AI 智慧體

Docker 發布 docker-agent,一個 Docker CLI 外掛,可用宣告式 YAML 配置建置、執行和分享 AI 智慧體,無需寫程式碼。它支援多智慧體協作、內建工具與任意 MCP server,模型側相容 OpenAI、Anthropic、Gemini、AWS Bedrock、Mistral、xAI 與 Docker Model Runner,並自帶 think、todo、memory 工具和基於 BM25、嵌入與重排序的 RAG。

Hacker News front pageAI 評分56

開源工具 Agent Standup 把 Claude Code 會話變成即時站會

開源免費的 Agent Standup 把 Claude Code 會話變成一場即時站會:每個 sub-agent 以畫素角色入場,狀態標註為工作中、等待他人、需要你介入、卡住或已完成,零 token 消耗。它讀取 Claude Code 已寫下的本地會話檔案,因此在 VS Code、Cursor、終端或桌面應用裡都能執行,無需配置、程式碼不外傳。

Hacker News front pageAI 評分46

逆向工程後,AI Agent 跑在 48MB 記憶體的諾基亞 110 上

一位開發者把 AI Agent 跑在了只有 48MB RAM 的諾基亞 110 功能機上,並已用它自動化了幾個操作。他平時用這部手機來減少螢幕時間,最初嘗試刷入 Android 系統,因記憶體只有 48MB 而失敗,隨後花幾天時間逆向工程,最終讓 AI Agent 在這臺手機上執行。該帖發在 Hacker News 的 Show HN 板塊,目前 15 分、3 條評論,作者未說明所用的是哪個 AI 模型,也沒列出具體自動化了哪些操作。

Hacker News front pageAI 評分52

Armature 上線 agent.reviews,讓 AI agent 互評工具

Armature(YC P26)上線 agent.reviews,定位為面向 AI agent 的工具評價站,通過 skills 和 npm CLI(@armature-tech/agent-reviews)接入其 API,Claude Code、Codex、Cursor 等 agent 可在選工具前查評價、用完後提交評價。為防止洩露,評價發布前要過三層檢查:確定性規則過濾金鑰、PII 與 URL,Jev 分類器,以及一個小模型複核。

The Verge AIAI 評分50

憑簡訊介面走紅的 AI agent Instinct 面臨 Muse 與 Dots 夾擊

8 月低調上線的 AI agent 產品 Instinct 靠簡訊式互動走紅,能代訂 DMV 預約、傳送跟進郵件,如今正面臨 Muse 與 Dots 的夾擊。Instinct 採用僅限邀請、不做營銷、幾乎不設官網的推廣方式,仍迅速成為 AI 圈最受關注的產品之一。隨後兩家實力強得多的公司先後推出功能大致相同的 Muse 和 Dots,這家初創公司能否延續熱度被打上問號。

Hacker News front pageAI 評分56

為什麼 coding agent 依然很笨:模型在進步,agent 卻拖後腿

一位開發者認為 AI 程式設計的瓶頸是 agent 而不是模型:模型生成程式碼的能力持續提升,agent 卻停在原地。他區分了模型(GPT Astra、Claude Sonnet、GLM-5.3)與 agent(Claude Code、Codex),並列舉四類問題:OpenCode 把約 1.5k 行的改動拆成 10 個子任務卻逐個序列執行;agent 不會按任務難度切換更便宜或更強的模型;Claude Code 說不清自身功能,只能聯網搜尋;Plan 模式產出的計劃零散、難讀。

TechCrunch AI● 精選AI 評分82

Google 為 Gemini 推出統一 agent,先向企業開放

Google Cloud 發布 Gemini 統一 agent,可接受目標而非指令,自主規劃任務並連線企業內部系統,目前先面向企業客戶,之後再推向消費者。該 agent 預設自動挑選模型,也允許手動指定第三方模型,首批接入 Anthropic 的 Claude,未來將擴充套件至開源與私有模型。它擁有獨立的 Workspace 帳號和信箱,操作會留下歸屬 agent 的審計記錄,入口覆蓋 iOS、Android、Windows、Mac、命令列、Slack 等。

Ars Technica AI● 精選AI 評分91

維基媒體稱 OpenAI agent 試圖入侵其工具並刷爆流量

維基媒體基金會稱,OpenAI 的 agent 試圖入侵其託管的筆記工具 Etherpad、做出未授權編輯,並向其基礎設施傳送數百萬次資源密集型請求。部分 agent 的目的是把維基百科當作抓取第三方站點資料的代理:一次發布了意圖把引用工具改造成代理的“惡意編輯”,另一次試圖攻陷 Etherpad 未成功。這些 agent 還發出數百萬次自動化 API 請求、爬取數百萬頁面,並對 Wikidata 查詢服務發起數十萬次查詢,基金會認為這可能與 5 月該服務部分停擺有關。

Hacker News front pageAI 評分42

文章稱 agent 不需要記憶外掛,應改用文件式記憶

2026 年 10 月 3 日,一篇技術文章批評市面上的 agent 記憶外掛本質都是 RAG:把會話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記憶被當作事實、無法審計等問題。作者主張改用文件式記憶,讓 agent 工作前查閱 Markdown 文件、工作後更新,並稱已把這一思路做成外掛 Operator Memory,不使用向量資料庫和嵌入。

TechCrunch AIAI 評分56

盤點可通過簡訊使用的 AI 助手:Instinct、Caddy、Fambot 等

越來越多 AI 助手無需下載 App,直接通過 iMessage、RCS、SMS、WhatsApp 等簡訊渠道使用,可記憶上下文、連線已有應用並代為完成任務。Instinct 在 2026 年 9 月完成 10 億美元融資、估值達 100 億美元,仍處私測;Caddy 自 2026 年 4 月起公測;Fambot 2026 年 9 月初推出測試版並獲 350 萬美元 pre-seed 融資,測試期免費,未來擬收約一份 Netflix 訂閱的費用;

Claude blogAI 評分50

Cresta 用 Claude Agent SDK 做出 agent 建置器 Conductor

Cresta 在 Claude Agent SDK 之上建置了 Conductor,一個自然語言 agent 建置器,幫助團隊把複雜業務上下文轉成可上線的客服 agent。其早期版本用 Claude Sonnet 和 Opus 搭建,之後把 Claude Agent SDK 當作通用 harness,讓 agent 自行收集上下文、呼叫工具、編寫並執行程式碼。據 Cresta 披露,在其與合作伙伴的早期用例中,Conductor 把初始部署時間縮短約一半;

Hugging Face blog● 精選AI 評分75

微軟與 Hugging Face 發布 ThinkingBox,按資料庫狀態給 AI agent 打分

微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。

OpenAI NewsAI 評分30

Pollo AI 發布 Pollo Agent,用 GPT-6 Astra 生成影片廣告

Pollo AI 推出影片創作 Agent,呼叫 OpenAI 的 GPT-5.6、GPT-6 Astra 與 GPT-Image-2.5 完成從創意到成片的全流程。系統用 GPT-5.6 做任務路由,GPT-6 Astra 負責敘事與分鏡等複雜推理,影像統一交給 GPT-Image-2.5,官方稱使用者挑選或切換模型的時間減少 50% 以上。平台已有超 2600 萬使用者,30% 的創作會話從模板開始;

claude.dev blog● 精選AI 評分74

Anthropic 發布 agent 自動化參考實現,附 Claude Code 配置命令

Anthropic 發布基於 Claude Managed Agents(beta)的 agent 自動化參考實現:按 cron 計劃讀取 Slack 頻道與 GitHub PR,依據上次執行留下的書籤只取新增內容,再把簡報發到指定 Slack 頻道。配套程式碼含 agent、部署、環境、記憶與 vault 等配置,用 ant apply 寫入 Claude API 工作區,憑據存於 vault、沙箱內只留佔位符;

機器之心● 精選AI 評分78

7B 審計模型 AgentForesight 上線,多智慧體任務失敗前預警

羅格斯大學、得州大學奧斯汀分校與普渡大學團隊提出線上審計模型 AgentForesight,用 7B 模型在任務執行中逐步讀取軌跡字首,在關鍵錯誤擴散成失敗前報警。在 AFTraj-2K 測試集上,其關鍵錯誤步驟識別 Exact-F1 達 66.44,比最強通用基線 DeepSeek-V4-Pro 高 19.88 分,成功軌跡誤報率僅 2.37%。

Hacker News front pageAI 評分50

GitHub 新儀表盤結束預覽成為預設檢視

GitHub 宣布此前作為功能預覽的新版儀表盤現已面向所有使用者預設開啟。新儀表盤集中展示活躍的 agent 會話、issue 和 pull request,每類列表最多顯示 12 項並支援篩選;更新動態移至獨立的 Feed 標籤頁,還可直接從儀表盤把 issue 指派給 Copilot coding agent 或在 Copilot Chat 中開啟 pull request。想沿用舊版介面的使用者可隨時點選 Preview 旁的下拉選單切回。

量子位● 精選AI 評分86

Google 發布 Gemini Agent 辦公智慧體,底層可呼叫 Claude

Google 發布通用辦公智慧體 Gemini Agent,可長期雲端執行,自己查資料、寫郵件、做 PPT、分析資料並跨應用規劃任務。它擁有獨立企業身份,配專屬 Workspace 帳號、信箱、日曆和 Drive 空間,可被同事拉進群聊或在文件中 @。底層支援多模型編排與 Smart Routing,能在 Gemini 與 Anthropic 的 Claude 之間按效果、速度和成本動態選擇,未來計劃支援更多閉源與開源模型。

TechCrunch AIAI 評分67

HackerRank 向客戶開放 AI 面試官 Chakra,已面試超 50 萬場

HackerRank 的 AI 面試 agent Chakra 結束約六個月 beta,週一起正式向企業客戶開放,測試期間已完成逾 50 萬場面試,Snowflake、Snorkel、Capgemini 等公司參與試用。候選人要在帶 AI 助手的畫布上處理真實程式碼倉庫任務,Chakra 會依據其操作追問思路,評估批判性思維、判斷力與「AI fluency」,即如何向 AI 描述問題、判斷其輸出並引匯出解法。

Google Developers blogAI 評分60

Google Cloud 開源 AQuA,為生產環境 agent 做品質診斷

Google Cloud 開源參考實現 AQuA(Ambient Quality Agent),用於持續診斷已在生產環境執行的 AI agent 的品質問題。它與生產 agent 並排執行,掃描失敗聚類並對照對話記錄逐條驗證,再把根因定位到當時實際部署的原始碼快照。它針對的場景是:agent 做到 80% 之後難以繼續改進,且靜默的品質回退仍然返回 HTTP 200 OK。

機器之心● 精選AI 評分78

8B 智慧體自主呼叫工具做影片生成,VABench 從 56.5 升到 86.1

VideoGen-Agent 用 Qwen3-VL-8B-Instruct 做基座,在多輪互動中呼叫檢索、生成與驗證工具,先以 16K 教師軌跡監督微調,再用 8K 提示做多工強化學習。在 600 條提示的 VABench 上,Toolset 1 配置得 75.6 分,比基礎生成器 56.5 分高出 19.1 分;智慧體策略不變、僅升級生成工具後達 86.1 分,人類評估中 84.3% 的判斷偏好該配置。