Cockroach Labs 的 MOLT 用智慧體醫院兩天完成 Db2 遷移支援
Cockroach Labs 用名為 MOLT Sinai 的智慧體流水線,在不到兩天內為遷移工具 MOLT 加上 IBM Db2 源支援,token 花費 4172 美元;2024 年為 MOLT 加 Oracle 支援則用了 9 個月、約 16 萬美元工程時間,即快 164 倍、便宜 38 倍。
給出智慧體流水線的量化結果:兩天、4172 美元完成過去 9 個月、約 16 萬美元的遷移工具開發,並披露 27 個 PR、55 次退回等過程資料,對評估 coding agent 落地品質的人有用。
原標題:Five months treating bugs like patients and coding agents like a medical team
閱讀原文
| 評分 | 85 / 82(平均 83,門檻 76) |
|---|---|
| 狀態 | 精選 |
相關報導
Block 用 Claude Fable 編排遷移,單次數千 PR 由數十個小模型執行
Square 與 Cash App 母公司 Block 的 AI 負責人 Bradley Axen 介紹了用 Claude Fable 5 編排大規模程式碼遷移的做法:單次遷移涉及跨倉庫的數百到數千個 PR、數百萬行程式碼,由 Fable 負責資料模型、API 規格等高層設計,再排程數十個 Opus、Sonnet 等更便宜的模型完成具體檔案修改與測試,全程跑在其開源協作工作區 Buzz 上。早期結果顯示前沿 token 集中在前期規劃、執行更多交給小模型,品質沒有下降。
Mistral Large 4 用 12 分鐘完成惡意軟體逆向分析
Mistral AI 展示 Mistral Large 4 處理惡意軟體逆向工程的能力:面對一個未知二進位制樣本,模型端到端完成分析,判定其為 Cobalt Strike,並提取出 IoC 與惡意軟體配置。它還會輸出一份報告,其中包含可用於攔截同類事件的 YARA 規則。官方稱這類「分佈外」調查任務原本可能需要一天的工作量,模型用 12 分鐘完成。
Oracle 超 10 萬員工用 ChatGPT 與 Codex,招聘調研提速 98%
Oracle 已有逾 10 萬名員工使用 ChatGPT Work 與 Codex,其中 ChatGPT 活躍使用者 13 萬、Codex 活躍使用者 9.5 萬以上。招聘團隊用 ChatGPT Work 搭建人才市場情報工具,把原本需 2–4 天完成的崗位調研壓縮到 15–20 分鐘,該環節耗時下降 98%;Applications Lab 用 Codex 把自然語言的業務問題轉成可靠 SQL 查詢,SRE 處理簡單事故從 1 小時縮短到幾分鐘。
ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
Mistral Large 4 在 AutomationBench 領先 Kimi K3、DeepSeek V4 Pro
Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。