500B token 反編譯遊戲:AI agent 編排的經驗與教訓
作者花 3 個月、約 500B token 讓 AI agent 把一款第一人稱射擊遊戲反編譯成 C++,最終程式碼可讀但語義錯誤。專案同時使用 Claude Max(20x)與 Codex Pro 訂閱,agent 跑在 Claude Code CLI 與 Codex CLI 裡,主力是 Sonnet 5,也用過 Opus 5.5、Luna、Sol、Terra;
罕見的長期實測:500B token、雙訂閱、4 個 agent 跑 3 個月反編譯,量化了壓縮閾值與指令文件的收益,也暴露缺少客觀驗收標準時 agent 會把程式碼寫成語義錯誤。
原標題:500B Tokens Later: Letting AI Agents Decompile a First-Person Shooter
閱讀原文
| 評分 | 78 / 82(平均 80,門檻 76) |
|---|---|
| 狀態 | 精選 |
相關報導
為什麼 coding agent 依然很笨:模型在進步,agent 卻拖後腿
一位開發者認為 AI 程式設計的瓶頸是 agent 而不是模型:模型生成程式碼的能力持續提升,agent 卻停在原地。他區分了模型(GPT Astra、Claude Sonnet、GLM-5.3)與 agent(Claude Code、Codex),並列舉四類問題:OpenCode 把約 1.5k 行的改動拆成 10 個子任務卻逐個序列執行;agent 不會按任務難度切換更便宜或更強的模型;Claude Code 說不清自身功能,只能聯網搜尋;Plan 模式產出的計劃零散、難讀。
開發者稱用 Claude Code 後不再手寫程式碼
一位寫了 18 年程式碼的開發者表示,自去年在 Claude Code 中使用 Opus 4.5 後,用自然語言描述需求比手寫程式碼更快,於是徹底停止了手寫程式碼。他所在的 Filestage 團隊月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。
Block 用 Claude Fable 編排遷移,單次數千 PR 由數十個小模型執行
Square 與 Cash App 母公司 Block 的 AI 負責人 Bradley Axen 介紹了用 Claude Fable 5 編排大規模程式碼遷移的做法:單次遷移涉及跨倉庫的數百到數千個 PR、數百萬行程式碼,由 Fable 負責資料模型、API 規格等高層設計,再排程數十個 Opus、Sonnet 等更便宜的模型完成具體檔案修改與測試,全程跑在其開源協作工作區 Buzz 上。早期結果顯示前沿 token 集中在前期規劃、執行更多交給小模型,品質沒有下降。
REA 上線:讓 coding agent 逆向分析程式並解釋行為
REA 是一套接入 coding agent 的逆向工程工具,用 npx rea-agents@latest setup 安裝並連線後,agent 就能檢查程式本身並解釋其行為。官方演示了兩個案例:讀取 Chrome 恐龍游戲執行中的指令碼,取回起始速度 6、每次更新加 0.001、上限 13 的加速規則,並據此重建一個可調速版本;以及分析 Windows Calculator 的 % 按鈕,發現 + 與 × 之後使用不同規則,因此 200 + 10% 得 220。
AI 程式設計模型集體滿口黑話:思維鏈壓縮省 70% Token
量子位發文吐槽,Fable、Sol 等與 Coding 沾邊的模型普遍輸出「15/15 全綠」「單腿啞火」這類黑話。文中分析,除 Coding 過擬合外,更主要的原因是廠商為省 Token 把思維鏈壓縮成「穴居人語」,OpenAI 最早這麼做,同樣一句話的 Token 消耗比白話文少 70%;Claude 自 Opus 4.6 起也開始如此。作者稱最新 Opus 5.5 語言能力回升明顯,而 Gemini 因輸出風格正常、排版層級清晰,被社群視為少數還能正常溝通的 AI。