研究:AI 程式設計代理生成更多程式碼,軟體產出未增加
哈佛大學研究者在 700 多家公司、70 萬名員工、3 億條工作事件的資料中發現,AI 程式設計工具並未讓企業軟體產出增加或減少用人,編碼階段省下的時間被下游環節吸收。程式碼審查時長明顯增加,pull request 更常需要返工,審查者留下的評論也更多。研究據此認為人工程式碼審查是 AI 編碼效率的主要瓶頸。
依意思最接近的 30 筆
哈佛大學研究者在 700 多家公司、70 萬名員工、3 億條工作事件的資料中發現,AI 程式設計工具並未讓企業軟體產出增加或減少用人,編碼階段省下的時間被下游環節吸收。程式碼審查時長明顯增加,pull request 更常需要返工,審查者留下的評論也更多。研究據此認為人工程式碼審查是 AI 編碼效率的主要瓶頸。
蒙大拿州立大學計算機教授 Carson Gross 在《Yes, and...》中回答“AI 時代還該不該學程式設計”:應該,但初級程式設計師必須親手寫程式碼。他認為 AI 能生成作業程式碼,但若因此不寫程式碼,就難以讀懂程式碼,可能造出自己無法理解和控制的系統;AI 更適合當助教,他給學生提供 AGENTS.md 來把編碼代理配置成助教。他同時判斷,未來寫程式碼本身的相對價值會下降,清晰溝通與理解業務會更重要。
Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。
Carson Gross 認為,即便 AI 工具已經出現,程式設計仍會是一門可行的職業。他把程式設計歸結為兩件事:用計算機解決問題,以及在解決問題的過程中學習控制複雜度;在他看來,很難想像未來懂得用計算機解決問題、並控制這些方案的複雜度會比今天更不值錢。這番話發布於 2026 年 10 月 8 日,標籤涵蓋電腦科學、職業與 AI。
一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。
一位開發者認為 AI 程式設計的瓶頸是 agent 而不是模型:模型生成程式碼的能力持續提升,agent 卻停在原地。他區分了模型(GPT Astra、Claude Sonnet、GLM-5.3)與 agent(Claude Code、Codex),並列舉四類問題:OpenCode 把約 1.5k 行的改動拆成 10 個子任務卻逐個序列執行;agent 不會按任務難度切換更便宜或更強的模型;Claude Code 說不清自身功能,只能聯網搜尋;Plan 模式產出的計劃零散、難讀。
一位寫了 18 年程式碼的開發者表示,自去年在 Claude Code 中使用 Opus 4.5 後,用自然語言描述需求比手寫程式碼更快,於是徹底停止了手寫程式碼。他所在的 Filestage 團隊月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。
OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。
越來越多 AI 助手不再需要單獨下載 App,直接用 iMessage、RCS 或簡訊就能對話並代辦任務。其中 Instinct 於 2026 年 9 月完成 10 億美元融資、估值達 100 億美元,並開始給使用者分配助手專屬信箱地址、上線代打電話功能,目前仍處私測。其餘選項裡,Folk 免費、Pro 訂閱 8.33 美元/月,Comma 開源且免費起步,Fambot 主打家庭日程並每晚推送次日摘要,Martin 訂閱 21 美元/月起。
據 The Information 報導,Meta 和微軟正在減少員工對 Claude 的依賴,推動開發者轉向自家 AI 工具。Meta 內部 Claude Code 活躍使用者從 6 萬降至 3 萬,減少 50%,由自研的 Muse Code 和 MetaCode 補位,最近一個 28 天週期在 Claude Code 上花費超 1.05 億美元。
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。
Anthropic 9 月 17 日披露,Claude 已在公司 26% 的研發工作中處於「主導」級別,3 月時僅約 1%,其程式碼庫中超過 80% 的程式碼由 Claude 編寫,模型最佳化訓練程式碼的加速比從約 3 倍升到約 52 倍。OpenAI 9 月 6 日宣布「研究實習生級」AI 研究助理如期到崗,研究部門每 1 個人類工作日對應約 3.1 個智慧體工作日。國內 MiniMax、智譜也披露了改進腳手架與推理基礎設施的工程閉環;
在 Criteo 任職的初級工程師 Elise Baturone 認為,AI 不會讓軟體工程師消失,真正的風險是資深工程師消失、所有人永遠停在 Junior 階段。她把自己的 agent 調教成導師,用蘇格拉底式提問做理解檢查,並把「提問」和「review」當成需要自己練的技能:追問 agent 解釋設計選擇、引用來源、論證可疑方案,常能讓它自己發現錯誤。她承認這更費 token,但先弄懂再上線更省事;
一篇隨筆主張,AI 正在瓦解支撐個人智力活動的知識社群,使長期、複雜的私人思考越來越難維持。作者以軟體工程為例:Claude Code 發布一年多,行業討論從編譯器、型別系統轉向 prompt、harness、loop,變得狹窄膚淺;寫部落格、開源庫或設計新程式語言也不再有人類讀者,內容只會被下一代模型消化。文章稱數學領域正經歷類似過程,並認為持續的知識活動需要共享成果與他人認可這兩種無法獨自獲得的輸入。
Astral Codex Ten 發布文章《Our AI Midwife》,記錄在分娩過程中使用 AI 的經歷。該文在 Hacker News 獲得 32 分、5 條評論,討論集中在 AI 在醫療場景中的實際作用與邊界。
OpenAI 開發者帳號發布 Codex CLI 演示影片,展示三種終端內用法:用語音啟動任務、跨多個專案管理 agent,以及在獨立 worktree 中並行探索另一條實現方向。推文未提及這些能力的上線時間、版本號或可用範圍。
Deferred 的發明者發表《Programming Isn't Special》,主張程式設計是藝術,程式設計師應像作家、藝術家那樣拒絕用 AI 寫程式碼。他反駁「程式只是功能性的」這一辯護,稱其源自 John Berger 所說的「神秘化」,忽略了記者、文案等日常創作同樣是藝術。
OpenAI 開發者帳號公布了一批正在建置 plugin extensions 的公司,包括 Adobe、Canva、Figma、Shopify、Instacart、Atlassian、tldraw 和 MagicPathAI。帖文只列出參與方,未說明這些外掛的具體功能、上線時間或適用平台,涉及設計、電商、協作與繪圖類產品。
聯想天禧 AI 自研程式碼智慧體框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)以 71% 的問題解決率位列全球第一,並通過官方 Verified 核驗。該評測基於真實 GitHub 專案問題與可復現執行環境,官方會審查全鏈路智慧體執行軌跡並排查答案、測試用例洩露。
因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。
越來越多 AI 助手無需下載 App,直接通過 iMessage、RCS、SMS、WhatsApp 等簡訊渠道使用,可記憶上下文、連線已有應用並代為完成任務。Instinct 在 2026 年 9 月完成 10 億美元融資、估值達 100 億美元,仍處私測;Caddy 自 2026 年 4 月起公測;Fambot 2026 年 9 月初推出測試版並獲 350 萬美元 pre-seed 融資,測試期免費,未來擬收約一份 Netflix 訂閱的費用;
OpenAI 為 Codex 的 Pro 使用者推出 composer 預測功能 beta 版:Codex 會依據當前對話內容以及使用者平時的說話方式,建議下一條要傳送的訊息。該功能目前僅面向 Pro 使用者開放,官方稱這是內部測試中最受喜愛的新功能之一。原文未提及價格、額度變化或正式版上線時間。
創作者 Marcello Costa 發布 AI 動畫短片 Monkey Business,整個流程幾乎都在 Claude 內完成。他通過 Seedance 2.5 skill 把自然語言提示轉成 Magnific 內 Seedance 2.5 工具的詳細視覺提示,99% 的過程發生在 Claude 中。首個提示設定專案規則後,僅用專案內術語即可協作,從開始到完成約 50 天,期間仍需大量迭代和後期製作。
OpenCode 發布 v1.18.35,核心改進是新增 canonical redirects,並提供 JSON 與 Markdown 兩種格式的 agent 可讀統計資料。本次修復讓 xAI 的工具呼叫結果可以攜帶受支援的圖片,不支援的圖片格式會被跳過,做法是把 @ai-sdk/xai 升級到 3.0.139。文件方面,Zen 文件新增 Fledge Alpha Free,生態外掛列表加入 opencode-supabase,該版本同時致謝 3 位社群貢獻者。
Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。
一名軟體工程師用 Claude Code 搭建 AI 流水線,在一夜 12 小時內檢索 435 萬頁荷蘭東印度公司檔案與舊報紙,發現一份被遺忘的隕石記錄、三隻未記錄的犀牛和未定位的火山噴發。他把 570 萬段文字轉成語義向量檢索,再用每百萬詞僅幾美分的小型決策模型 Jev 初篩(讀 5.9 萬條大象記錄約 3 美元),由 Claude Haiku 精讀並核對原始掃描頁。靈感來自歷史學家 Benjamin Breen 用 Opus 5.5 找到的 1615 年渡渡鳥目擊記錄。
一位開發者把 AI Agent 跑在了只有 48MB RAM 的諾基亞 110 功能機上,並已用它自動化了幾個操作。他平時用這部手機來減少螢幕時間,最初嘗試刷入 Android 系統,因記憶體只有 48MB 而失敗,隨後花幾天時間逆向工程,最終讓 AI Agent 在這臺手機上執行。該帖發在 Hacker News 的 Show HN 板塊,目前 15 分、3 條評論,作者未說明所用的是哪個 AI 模型,也沒列出具體自動化了哪些操作。
OpenAI 開發者帳號宣布,Codex 桌面應用面向 Pro 使用者開放 composer 預測功能的 beta,用於本地任務。輸入時按 Tab 即可接受建議,也可以先手動編輯再傳送;該功能可在設定中關閉。官方目前只說明這是面向 Pro 使用者的 beta,未提及是否或何時覆蓋其他套餐與平台,細節見 OpenAI 幫助中心的說明文章。
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。