ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
依意思最接近的 16 筆
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。
愛爾蘭一所公立繼續教育學院的教師發帖,稱已獲得資金建成一個小型 AI 實驗室,硬體配置尚可,目標是讓學生學到使用 ChatGPT 之外的實用技能,因此向社群徵集教學方向建議。帖子未透露具體硬體型號、課程安排或學生人數。
OpenAI 開發者官方帳號發布推文,以「Building with the Agents API?」為題,提示開發者關注 Agents API 的最新動態。推文正文僅有一句「Catch up on what's new:」,未披露具體更新內容、發布時間或功能細節,後續資訊需以官方發布為準。
在 Capcom Open Conference RE: 2026 上,程式設計師 Satoshi Ishida 以「REX 專案的前景與未來」為題演講,稱制作《生化危機》級別遊戲時連簡單任務都極其耗時,解決方案是把 AI 技術成功整合進開發流程。他表示為「與 AI 共同創造遊戲的未來」做準備。Capcom 此前曾稱不會使用 AI。
Google DeepMind 發布 SynthID Bio,一套面向 AI 生成生物設計的水印方法。官方稱這是全球首次能在不影響生物功能的前提下,把不可感知的簽名直接嵌入蛋白質序列。該技術屬於 SynthID 水印體系的新分支,具體覆蓋範圍、檢測方式與可用時間尚未公布。
一位使用者僅向 Opus 5.5 提供創意、工作資料夾和音樂檔案,模型便自主完成了從調研到成片的全流程。它檢索了四年 AI 發展資料與素材,擷取文章和介面截圖,編寫 HTML 與動畫程式碼,用 Playwright 渲染畫面、FFmpeg 合成並加入音效,最終輸出完整影片。
企業一度鼓勵員工儘可能多地使用 AI,即所謂的 #tokenmaxxing,隨後賬單隨之而來。報導援引一項針對近 400 家企業的調查稱,其中只有 11% 能準確預測自己的 AI 支出。AI 使用量以 token 計量,而企業發現 token 很難統計,這讓 AI 預算幾乎無法編制。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
AI 3D 生成公司 Meshy 披露,其 ARR 從 100 萬美元增長至 1 億美元,用時不到兩年,比 HeyGen 的 29 個月更快。Meshy 7 在自建幾何對齊基準中造型比例、空間分佈、表面細節三項指標領先受測模型,7.1 將幾何生成解析度從 2048³ 提升至 4096³。三七互娛已將其接入生產流程,基礎模型階段雕刻工作量減少 30% 至 40%。
輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。
Anthropic 宣布投入 1 億美元,通過 Claude Frontier Academy 培養 10000 名 Frontier Deployed Engineers,目標在 2027 年底前完成。首批學員來自埃森哲、貝恩、凱捷、澳大利亞聯邦銀行、德勤、麥肯錫、摩根士丹利和諾和諾德等企業。按人數計算,人均培訓投入約 1 萬美元。
Artificial Analysis 的 Video Arena 文生影片排行榜上,影視公司 Utopai 的定製模型 Utopai X 以 1150 的 Elo 評分位列全球第二、全美第一,這是該榜採用雙盲投票以來首次有影視公司定製模型進入前列。Utopai X 基於 MiniMax H3 架構做深度定製後訓練,在評測的 10 項細分能力中 7 項超越基座模型,音訊同步與物理規律排名第一,光照與材質、鏡頭控制排名第二。
Stripe 設計負責人 Katie Dill 在 2026 年 9 月 10 日舊金山 Lenny and Friends Summit 的演講中提出,AI 讓建置產品更容易,但產品容易淪為通用的殭屍 UI。她認為好設計仍取決於清晰的觀點、對使用者的理解和對細節的用心,並分享瞭如何把標準寫進 AI 工具、在初稿之外繼續編輯、用 AI 做出更原創的產品。該影片由 Lenny's Podcast 於 9 月 25 日發布,時長 21 分 47 秒。
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。