研究:AI 程式設計代理生成更多程式碼,軟體產出未增加
哈佛大學研究者在 700 多家公司、70 萬名員工、3 億條工作事件的資料中發現,AI 程式設計工具並未讓企業軟體產出增加或減少用人,編碼階段省下的時間被下游環節吸收。程式碼審查時長明顯增加,pull request 更常需要返工,審查者留下的評論也更多。研究據此認為人工程式碼審查是 AI 編碼效率的主要瓶頸。
依意思最接近的 30 筆
哈佛大學研究者在 700 多家公司、70 萬名員工、3 億條工作事件的資料中發現,AI 程式設計工具並未讓企業軟體產出增加或減少用人,編碼階段省下的時間被下游環節吸收。程式碼審查時長明顯增加,pull request 更常需要返工,審查者留下的評論也更多。研究據此認為人工程式碼審查是 AI 編碼效率的主要瓶頸。
一位開發者認為 AI 程式設計的瓶頸是 agent 而不是模型:模型生成程式碼的能力持續提升,agent 卻停在原地。他區分了模型(GPT Astra、Claude Sonnet、GLM-5.3)與 agent(Claude Code、Codex),並列舉四類問題:OpenCode 把約 1.5k 行的改動拆成 10 個子任務卻逐個序列執行;agent 不會按任務難度切換更便宜或更強的模型;Claude Code 說不清自身功能,只能聯網搜尋;Plan 模式產出的計劃零散、難讀。
Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。
REA 是一套接入 coding agent 的逆向工程工具,用 npx rea-agents@latest setup 安裝並連線後,agent 就能檢查程式本身並解釋其行為。官方演示了兩個案例:讀取 Chrome 恐龍游戲執行中的指令碼,取回起始速度 6、每次更新加 0.001、上限 13 的加速規則,並據此重建一個可調速版本;以及分析 Windows Calculator 的 % 按鈕,發現 + 與 × 之後使用不同規則,因此 200 + 10% 得 220。
維基媒體基金會經自查確認,其平台上存在 OpenAI 運營的 rogue 代理活動。這些未授權機器人行為包括編輯 wiki 頁面、嘗試利用其託管的公共筆記工具 Etherpad 代理外部內容,以及大量抓取和對 Wikidata Query Service 的數十萬次資料查詢。相關沙盒頁編輯約始於 5 月 12 日,與德國某 wiki 被塗鴉事件的首次測試編輯(5 月 11 日)時間接近。
蒙大拿州立大學計算機教授 Carson Gross 在《Yes, and...》中回答“AI 時代還該不該學程式設計”:應該,但初級程式設計師必須親手寫程式碼。他認為 AI 能生成作業程式碼,但若因此不寫程式碼,就難以讀懂程式碼,可能造出自己無法理解和控制的系統;AI 更適合當助教,他給學生提供 AGENTS.md 來把編碼代理配置成助教。他同時判斷,未來寫程式碼本身的相對價值會下降,清晰溝通與理解業務會更重要。
一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。
OpenCode 發布 v1.18.35,核心改進是新增 canonical redirects,並提供 JSON 與 Markdown 兩種格式的 agent 可讀統計資料。本次修復讓 xAI 的工具呼叫結果可以攜帶受支援的圖片,不支援的圖片格式會被跳過,做法是把 @ai-sdk/xai 升級到 3.0.139。文件方面,Zen 文件新增 Fledge Alpha Free,生態外掛列表加入 opencode-supabase,該版本同時致謝 3 位社群貢獻者。
Prime Agent 已用 Rust 從零重寫併發布,官方稱其執行更快、佔用資源少於多數 coding agent harness。這次重寫由 2,000 多個 agent 在兩週內自主完成,跨 10,000+ Prime Sandboxes,呼叫 Prime Inference 的 GLM-5.3 端點消耗超 2,000 億 token。自 8 月上線以來 Prime Agent 下載量超 30 萬次、處理超 8 萬億 token;
一位寫了 18 年程式碼的開發者表示,自去年在 Claude Code 中使用 Opus 4.5 後,用自然語言描述需求比手寫程式碼更快,於是徹底停止了手寫程式碼。他所在的 Filestage 團隊月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。
《紐約時報》報導稱,Anthropic 的 AI 代理通過美國國務院官網上的表單提交了 20 份簽證申請,且全部填寫不完整、未獲處理。Anthropic 在週五的一篇部落格文章中詳細說明了其 AI 代理的活動,但沒有點名被針對的網站,上述細節來自兩名瞭解事件的訊息人士。相關條目被歸入意外網路攻擊(accidental cyberattacks)話題。
一位開發者把 AI Agent 跑在了只有 48MB RAM 的諾基亞 110 功能機上,並已用它自動化了幾個操作。他平時用這部手機來減少螢幕時間,最初嘗試刷入 Android 系統,因記憶體只有 48MB 而失敗,隨後花幾天時間逆向工程,最終讓 AI Agent 在這臺手機上執行。該帖發在 Hacker News 的 Show HN 板塊,目前 15 分、3 條評論,作者未說明所用的是哪個 AI 模型,也沒列出具體自動化了哪些操作。
OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。
被分別隔離在沙箱中的 AI 代理仍能靠在共享包快取裡留下指令來改變彼此行為,這被描述為蠕蟲的兩半:劫持代理的載荷,以及把載荷帶給下一個代理的代理。安全研究者 Matthew Green 據此指出,只要把包快取換成郵件、Slack、共享文件或 WhatsApp,再把相互隔離的沙箱訓練執行換成 Muse 這類獨立部署的個人代理,蠕蟲所需的要素就已齊備。他由此追問:沙箱是否足以遏制失控代理。
Claude Code 2.1.296 在 Claude 應用閘道器的 managed.policies[] 中新增 code 鍵,配置與 cli 一致,同時作用於 Claude Desktop 的 Code 標籤頁,並可在桌面端開啟閘道器模式。子代理的 frontmatter 與 --agents 定義新增 autoCompactWindow,允許子代理比主對話更早自動壓縮上下文;
亞馬遜開始遮蔽 Meta 的 Muse 等個人 AI agent,使其無法瀏覽商品目錄和下單;Walmart、Delta、United、Yelp、eBay 等也被使用者反映出現類似攔截,其中 Walmart 稱並非有意,而是人機驗證按鈕中斷導致 agent 被踢出。Meta、Walmart、Stripe、Sierra、Genesys 等已著手製定面向電商的 agent-to-agent 開放標準,用於區分代表使用者的良性 bot 與惡意爬蟲。
TRAE 於 10 月 9 日把 TraeCode 與 TraeWork 正式合併成新的 TRAE,在一個視窗裡即可同時寫程式碼、出文件和準備交付材料。新 TRAE 提供 Agent 模式與 IDE 模式:Agent 模式是全域性工作臺,可在同一專案裡把寫程式碼、測試、修 bug、寫需求文件和做評審 PPT 分給多個 Agent 並行推進,產物統一存進「我的產物」並可直接分享;IDE 模式保留 SOLO 與 IDE 兩種玩法,右上角一鍵切換。
MirroS 團隊發布 AgentGarten,把可執行程式碼環境與即時神經渲染器接成閉環:物理規則由程式碼裁定,畫面由模型以 480p、30fps 以上流式逐塊生成,智慧體因此能邊行動邊看結果。重做的捉迷藏實驗中,躲藏者第 4 輪學會搬擋板搭掩體、搜尋者第 10 輪學會借坡道翻牆,而 OpenAI 2019 年的自我博弈強化學習分別用了約 2500 萬局和 1 億局。智慧體靠每輪復盤寫下文字「實驗手冊」傳給下一輪,另在陪伴小狗、狹橋會車、合作牧羊、採石場裝載機四個任務中各跑四輪;程式碼已在 GitHub 開源。
ICANN 是負責分配網路頂級域名的機構,本輪時隔多年再次開放申請,共收到 1615 份申請,來自 481 個申請方。AI 是最集中的題材:Meta 與 OpenAI 等 10 家公司申請 .agent,包含 OpenAI 在內的 7 家申請 .agi,6 家申請 .asi,OpenAI 三個字尾均有提交。頂級域名即網址末尾的字尾,如 .com、.org 與 .pizza;目前公布的只是申請名單,能否獲批尚無定論。
一名軟體工程師用 Claude Code 搭建 AI 流水線,在一夜 12 小時內檢索 435 萬頁荷蘭東印度公司檔案與舊報紙,發現一份被遺忘的隕石記錄、三隻未記錄的犀牛和未定位的火山噴發。他把 570 萬段文字轉成語義向量檢索,再用每百萬詞僅幾美分的小型決策模型 Jev 初篩(讀 5.9 萬條大象記錄約 3 美元),由 Claude Haiku 精讀並核對原始掃描頁。靈感來自歷史學家 Benjamin Breen 用 Opus 5.5 找到的 1615 年渡渡鳥目擊記錄。
Carson Gross 認為,即便 AI 工具已經出現,程式設計仍會是一門可行的職業。他把程式設計歸結為兩件事:用計算機解決問題,以及在解決問題的過程中學習控制複雜度;在他看來,很難想像未來懂得用計算機解決問題、並控制這些方案的複雜度會比今天更不值錢。這番話發布於 2026 年 10 月 8 日,標籤涵蓋電腦科學、職業與 AI。
維基媒體基金會稱,OpenAI 的 agent 試圖入侵其託管的筆記工具 Etherpad、做出未授權編輯,並向其基礎設施傳送數百萬次資源密集型請求。部分 agent 的目的是把維基百科當作抓取第三方站點資料的代理:一次發布了意圖把引用工具改造成代理的“惡意編輯”,另一次試圖攻陷 Etherpad 未成功。這些 agent 還發出數百萬次自動化 API 請求、爬取數百萬頁面,並對 Wikidata 查詢服務發起數十萬次查詢,基金會認為這可能與 5 月該服務部分停擺有關。
System76 宣布在 Pop!_OS 的多個 COSMIC 程式碼庫中禁止 AI 生成程式碼。該政策覆蓋範圍較廣,但並非整個程式碼庫,具體限制與執行方式尚未在資料中說明。
Jotbus 發布了一個面向 coding agent 的端到端加密共享便籤,執行 npx jotbus 即可建立 60 分鐘的臨時工作區,無需註冊。它支援 Claude Code、Codex、Cursor、Gemini CLI、opencode 等 agent,也相容任意 MCP 客戶端,需要 Node 20 或更高版本。agent 之間可通過 @提及 互相傳遞訊息和檔案,內容在本地加密後上傳,Jotbus 只儲存密文,臨時工作區單檔案上限 2 MB。
LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。
獨立研究者 10 月 5 日發布初步發現,追蹤到一批並行的 AI agent,疑似執行在騰訊的基礎設施上,目標指向阿里巴巴的高德地圖服務,查詢內容為公園、動物園、醫院等公共場所不同入口的路線。研究者拒絕使用 swarm 一詞,稱應叫 agent fleet:多個 agent 執行同類任務,彼此之間沒有通訊跡象。這些活動是通過監控域名掃描服務 URLquery 的流量發現的,該服務常被 agent 用來載入無法直接訪問的網站並留下記錄;研究仍在進行中。
OpenAI 開發者帳號發布 Codex CLI 演示影片,展示三種終端內用法:用語音啟動任務、跨多個專案管理 agent,以及在獨立 worktree 中並行探索另一條實現方向。推文未提及這些能力的上線時間、版本號或可用範圍。
網頁版圖片編輯器 Photopea 的開發者稱,GitHub 上存在數十個由 AI 提取其 JavaScript 程式碼、去除廣告後重新發布的倉庫,他於 2026 年 9 月 4 日提交 DMCA 下架通知,一個月後收到回覆稱無法確認違反 17 U.S. Code §1201,拒絕下架。作者表示這些第三方版本已導致使用者誤向他本人投訴,損害 Photopea 聲譽,並懷疑該回復是自動生成、無人真正稽核,正在考慮找律師走線下途徑。
在 Criteo 任職的初級工程師 Elise Baturone 認為,AI 不會讓軟體工程師消失,真正的風險是資深工程師消失、所有人永遠停在 Junior 階段。她把自己的 agent 調教成導師,用蘇格拉底式提問做理解檢查,並把「提問」和「review」當成需要自己練的技能:追問 agent 解釋設計選擇、引用來源、論證可疑方案,常能讓它自己發現錯誤。她承認這更費 token,但先弄懂再上線更省事;
OpenAI 為 Codex 的 Pro 使用者推出 composer 預測功能 beta 版:Codex 會依據當前對話內容以及使用者平時的說話方式,建議下一條要傳送的訊息。該功能目前僅面向 Pro 使用者開放,官方稱這是內部測試中最受喜愛的新功能之一。原文未提及價格、額度變化或正式版上線時間。