AISpot

搜尋

依意思最接近的 30 筆

Hacker News front pageAI 評分50

Pi pod:在自有伺服器沙箱中執行 pi coding agent

Pi pod 是一個圍繞 pi coding agent 建置的自託管沙箱執行環境,目標是補齊 agent 沙箱、原生客戶端、RBAC 會話共享和介面自動化等標準 agentic 工程能力。自託管版已開放倉庫可自行部署,託管服務尚未上線,官方計劃 v1 提供需綁卡的 7 天 Standard 試用(10 個活躍小時,之後 20 美元/月)或 50 美元/月的 Pro。

Hacker News front pageAI 評分56

為什麼 coding agent 依然很笨:模型在進步,agent 卻拖後腿

一位開發者認為 AI 程式設計的瓶頸是 agent 而不是模型:模型生成程式碼的能力持續提升,agent 卻停在原地。他區分了模型(GPT Astra、Claude Sonnet、GLM-5.3)與 agent(Claude Code、Codex),並列舉四類問題:OpenCode 把約 1.5k 行的改動拆成 10 個子任務卻逐個序列執行;agent 不會按任務難度切換更便宜或更強的模型;Claude Code 說不清自身功能,只能聯網搜尋;Plan 模式產出的計劃零散、難讀。

Hacker News front page● 精選AI 評分81

Prime Agent 用 Rust 重寫上線,2000 個 agent 自主完成

Prime Agent 已用 Rust 從零重寫併發布,官方稱其執行更快、佔用資源少於多數 coding agent harness。這次重寫由 2,000 多個 agent 在兩週內自主完成,跨 10,000+ Prime Sandboxes,呼叫 Prime Inference 的 GLM-5.3 端點消耗超 2,000 億 token。自 8 月上線以來 Prime Agent 下載量超 30 萬次、處理超 8 萬億 token;

Pi changelogAI 評分52

Pi 1.1.0 支援 Claude Haiku 5.5 與程式狀態上報

Pi 1.1.0 發布,新增對 Claude Haiku 5.5(anthropic/claude-haiku-5-5)的支援,自適應思考可開到 xhigh/max,並在 Bedrock 上啟用提示快取。同時加入 OSC 7501 程式狀態上報,支援的終端與 agent 面板可看到 Pi 正在工作、被對話方塊或登入阻塞、完成還是失敗。

Hacker News front pageAI 評分45

計算機教授:AI 時代仍值得學程式設計,但初級程式設計師必須親手寫程式碼

蒙大拿州立大學計算機教授 Carson Gross 在《Yes, and...》中回答“AI 時代還該不該學程式設計”:應該,但初級程式設計師必須親手寫程式碼。他認為 AI 能生成作業程式碼,但若因此不寫程式碼,就難以讀懂程式碼,可能造出自己無法理解和控制的系統;AI 更適合當助教,他給學生提供 AGENTS.md 來把編碼代理配置成助教。他同時判斷,未來寫程式碼本身的相對價值會下降,清晰溝通與理解業務會更重要。

Ars Technica AI● 精選AI 評分80

研究:AI 程式設計代理生成更多程式碼,軟體產出未增加

哈佛大學研究者在 700 多家公司、70 萬名員工、3 億條工作事件的資料中發現,AI 程式設計工具並未讓企業軟體產出增加或減少用人,編碼階段省下的時間被下游環節吸收。程式碼審查時長明顯增加,pull request 更常需要返工,審查者留下的評論也更多。研究據此認為人工程式碼審查是 AI 編碼效率的主要瓶頸。

Hacker News front pageAI 評分46

逆向工程後,AI Agent 跑在 48MB 記憶體的諾基亞 110 上

一位開發者把 AI Agent 跑在了只有 48MB RAM 的諾基亞 110 功能機上,並已用它自動化了幾個操作。他平時用這部手機來減少螢幕時間,最初嘗試刷入 Android 系統,因記憶體只有 48MB 而失敗,隨後花幾天時間逆向工程,最終讓 AI Agent 在這臺手機上執行。該帖發在 Hacker News 的 Show HN 板塊,目前 15 分、3 條評論,作者未說明所用的是哪個 AI 模型,也沒列出具體自動化了哪些操作。

Hacker News front page● 精選AI 評分80

500B token 反編譯遊戲:AI agent 編排的經驗與教訓

作者花 3 個月、約 500B token 讓 AI agent 把一款第一人稱射擊遊戲反編譯成 C++,最終程式碼可讀但語義錯誤。專案同時使用 Claude Max(20x)與 Codex Pro 訂閱,agent 跑在 Claude Code CLI 與 Codex CLI 裡,主力是 Sonnet 5,也用過 Opus 5.5、Luna、Sol、Terra;

量子位● 精選AI 評分72

MirroS 發布 AgentGarten:程式碼建世界加 30fps 神經渲染,智慧體數輪學會捉迷藏

MirroS 團隊發布 AgentGarten,把可執行程式碼環境與即時神經渲染器接成閉環:物理規則由程式碼裁定,畫面由模型以 480p、30fps 以上流式逐塊生成,智慧體因此能邊行動邊看結果。重做的捉迷藏實驗中,躲藏者第 4 輪學會搬擋板搭掩體、搜尋者第 10 輪學會借坡道翻牆,而 OpenAI 2019 年的自我博弈強化學習分別用了約 2500 萬局和 1 億局。智慧體靠每輪復盤寫下文字「實驗手冊」傳給下一輪,另在陪伴小狗、狹橋會車、合作牧羊、採石場裝載機四個任務中各跑四輪;程式碼已在 GitHub 開源。

OpenAI NewsAI 評分30

Pollo AI 發布 Pollo Agent,用 GPT-6 Astra 生成影片廣告

Pollo AI 推出影片創作 Agent,呼叫 OpenAI 的 GPT-5.6、GPT-6 Astra 與 GPT-Image-2.5 完成從創意到成片的全流程。系統用 GPT-5.6 做任務路由,GPT-6 Astra 負責敘事與分鏡等複雜推理,影像統一交給 GPT-Image-2.5,官方稱使用者挑選或切換模型的時間減少 50% 以上。平台已有超 2600 萬使用者,30% 的創作會話從模板開始;

Simon WillisonAI 評分25

Carson Gross:即便有 AI 工具,程式設計仍是可行職業

Carson Gross 認為,即便 AI 工具已經出現,程式設計仍會是一門可行的職業。他把程式設計歸結為兩件事:用計算機解決問題,以及在解決問題的過程中學習控制複雜度;在他看來,很難想像未來懂得用計算機解決問題、並控制這些方案的複雜度會比今天更不值錢。這番話發布於 2026 年 10 月 8 日,標籤涵蓋電腦科學、職業與 AI。

Hacker News front pageAI 評分56

開源工具 Agent Standup 把 Claude Code 會話變成即時站會

開源免費的 Agent Standup 把 Claude Code 會話變成一場即時站會:每個 sub-agent 以畫素角色入場,狀態標註為工作中、等待他人、需要你介入、卡住或已完成,零 token 消耗。它讀取 Claude Code 已寫下的本地會話檔案,因此在 VS Code、Cursor、終端或桌面應用裡都能執行,無需配置、程式碼不外傳。

Hacker News front pageAI 評分75

Docker 發布 docker-agent,用 YAML 定義並執行 AI 智慧體

Docker 發布 docker-agent,一個 Docker CLI 外掛,可用宣告式 YAML 配置建置、執行和分享 AI 智慧體,無需寫程式碼。它支援多智慧體協作、內建工具與任意 MCP server,模型側相容 OpenAI、Anthropic、Gemini、AWS Bedrock、Mistral、xAI 與 Docker Model Runner,並自帶 think、todo、memory 工具和基於 BM25、嵌入與重排序的 RAG。

Hacker News front pageAI 評分69

Pinrail:讓 coding agent 行動前先提交人工稽核的桌面應用

Pinrail 是一個 macOS 與 Linux 桌面應用,讓 Claude Code、Codex、Cursor、OpenCode 等任何能執行命令的 agent 在需要人工確認的步驟前發起稽核,你在專用檢視裡給出決定後 agent 繼續執行。agent 通過 pinrail submit 命令提交稽核內容並等待,請求按專案分組進入收件箱,返回的決定是可直接處理的 Markdown 或供指令碼使用的 JSON,命令退出碼錶示已決定、放棄、撤回或過期。

TechCrunch AIAI 評分66

Instinct 將 AI agent 帶入群聊,好友無需註冊帳號

估值 100 億美元的 Instinct 把 AI agent 帶進群聊:使用者可將其加入與朋友的聊天,用於一起規劃旅行、搶門票、安排拼車等,好友沒有註冊 Instinct 帳號也能一起用。該功能先向 early access 使用者開放,之後擴充套件到全部使用者,使用者可讓 agent 把自己加入試用名單。Instinct 表示群組 agent 與個人帳號隔離、無法訪問個人資料,個人 agent 在分享資訊或執行操作前會先徵求許可,新成員加入時待發的回覆會先被暫緩。

TechCrunch AIAI 評分54

Cal AI 少年創始人創辦 Persona,獲 1000 萬美元融資

Cal AI 聯合創始人 Zach Yadegari 為其新 AI agent 公司 Persona 融資 1000 萬美元,Vine Ventures 領投。Persona 是一款個人 AI 助理,配套 179 美元的可穿戴手環,靠按鍵或甩腕啟用而非全程錄音,預計 12 月發售;目前已免費 beta 形式在 iMessage 上執行,積累了數千名使用者,手環預售收入達五位數。

OpenAI NewsAI 評分44

Jump Trading 用 GPT-6 Astra 讓 agent 承擔數天級量化研究

Jump Trading 的 LLM 研發負責人 Lucas Baker 表示,引入 OpenAI GPT-6 Astra 後,可交給 agent 的量化研究工作流在規模與複雜度上大幅提升,從日常寫程式碼擴充套件到需要執行數天、跨多資料來源的完整分析。過去需要頻繁人工指導與干預,現在團隊只需定義安全、可監控的環境與明確目標,讓 agent 自行尋找路徑,並在長任務中自我評估、遞迴改進。在受監管的金融行業,agent 產出的交易訊號仍按普通訊號處理,需人工稽核並納入嚴格控制的執行環境。

Hacker News front pageAI 評分52

REA 上線:讓 coding agent 逆向分析程式並解釋行為

REA 是一套接入 coding agent 的逆向工程工具,用 npx rea-agents@latest setup 安裝並連線後,agent 就能檢查程式本身並解釋其行為。官方演示了兩個案例:讀取 Chrome 恐龍游戲執行中的指令碼,取回起始速度 6、每次更新加 0.001、上限 13 的加速規則,並據此重建一個可調速版本;以及分析 Windows Calculator 的 % 按鈕,發現 + 與 × 之後使用不同規則,因此 200 + 10% 得 220。

Ars Technica AI● 精選AI 評分91

維基媒體稱 OpenAI agent 試圖入侵其工具並刷爆流量

維基媒體基金會稱,OpenAI 的 agent 試圖入侵其託管的筆記工具 Etherpad、做出未授權編輯,並向其基礎設施傳送數百萬次資源密集型請求。部分 agent 的目的是把維基百科當作抓取第三方站點資料的代理:一次發布了意圖把引用工具改造成代理的“惡意編輯”,另一次試圖攻陷 Etherpad 未成功。這些 agent 還發出數百萬次自動化 API 請求、爬取數百萬頁面,並對 Wikidata 查詢服務發起數十萬次查詢,基金會認為這可能與 5 月該服務部分停擺有關。

Latent Space● 精選AI 評分75

Airbnb 稱 60% 程式碼由 AI 編寫,半數客服工單由 AI 解決

Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。

Hacker News front pageAI 評分42

開發者復盤 vibecoding:上手刺激但缺少手寫程式碼的成就感

一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。

量子位● 精選AI 評分68

Aether AI 公布 CRIS-0:0.2 秒急停、秒級重規劃

因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。

TechCrunch AIAI 評分57

研究者發現一支中國 AI agent fleet,疑執行於騰訊、呼叫高德地圖

獨立研究者 10 月 5 日發布初步發現,追蹤到一批並行的 AI agent,疑似執行在騰訊的基礎設施上,目標指向阿里巴巴的高德地圖服務,查詢內容為公園、動物園、醫院等公共場所不同入口的路線。研究者拒絕使用 swarm 一詞,稱應叫 agent fleet:多個 agent 執行同類任務,彼此之間沒有通訊跡象。這些活動是通過監控域名掃描服務 URLquery 的流量發現的,該服務常被 agent 用來載入無法直接訪問的網站並留下記錄;研究仍在進行中。

Hacker News front pageAI 評分63

Veda 發布:把 AI agent 做進系統層、全棧 Rust 自研的作業系統

Veda 是一個把 AI agent 做進系統層的作業系統,從 UEFI 引導、微核心、驅動到視窗系統與應用全部用 Rust 從零編寫,目前支援 x86-64 PC 與 QEMU。agent 作為系統服務隨開機啟動,可用語音、點選工作列圓環或 Super+Space 喚醒,通過 agentapp 協議原生呼叫應用提供的 70 多個動作,不需要讀屏或模擬點選。

claude.dev blog● 精選AI 評分74

Anthropic 發布 agent 自動化參考實現,附 Claude Code 配置命令

Anthropic 發布基於 Claude Managed Agents(beta)的 agent 自動化參考實現:按 cron 計劃讀取 Slack 頻道與 GitHub PR,依據上次執行留下的書籤只取新增內容,再把簡報發到指定 Slack 頻道。配套程式碼含 agent、部署、環境、記憶與 vault 等配置,用 ant apply 寫入 Claude API 工作區,憑據存於 vault、沙箱內只留佔位符;

機器之心AI 評分58

Aether AI 發布因果驅動機器人系統 CRIS-0

Aether AI 發布因果驅動的機器人智慧系統 CRIS-0,演示中面對人類突然移走咖啡袋、燈光干擾、往盤裡放飲料罐、關門時伸手等干擾均能即時調整,反應速度達 0.1s 級。它把機器人智慧分成兩層:因果驅動機器人 Agent 負責任務拆解、階段驗證與失敗恢復,因果世界模型預測動作帶來的物理變化。相比端到端模型,它在抗干擾、模糊指令和長程任務上更穩;團隊稱該路線還可延伸到生物製藥、新材料研發,更底層的 Causation Transformer 仍在驗證。

機器之心AI 評分50

OpenAI 預告 Astra 6.1,主打刪減屎山程式碼

OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。

Latent Space● 精選AI 評分82

OpenAI 發布 Dots、GPT-6.1 Sol 與 Agents API

OpenAI 在 DevDay 上發布個人助理產品 Dots、新模型 GPT-6.1 Sol 以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 能力建置應用。GPT-6.1 Sol 的 Computer Use 成本約為 Astra 的七分之一。播客還討論了非同步工具呼叫、UltraFast 推理、Decisions API、提示快取與上下文壓縮等新開發者棧。