OpenAI 將 RSI 列為戰略目標,MemoraX 展示記憶驅動自進化
OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。
依意思最接近的 9 筆
OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。
Aether AI 發布因果驅動的機器人智慧系統 CRIS-0,演示中面對人類突然移走咖啡袋、燈光干擾、往盤裡放飲料罐、關門時伸手等干擾均能即時調整,反應速度達 0.1s 級。它把機器人智慧分成兩層:因果驅動機器人 Agent 負責任務拆解、階段驗證與失敗恢復,因果世界模型預測動作帶來的物理變化。相比端到端模型,它在抗干擾、模糊指令和長程任務上更穩;團隊稱該路線還可延伸到生物製藥、新材料研發,更底層的 Causation Transformer 仍在驗證。
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
Google 等提出 RRSI,用正則化約束 Agent Harness 的遞迴自我改進(RSI):不鎖死自我修改能力,而是限制每輪同時修改的機制數量、保留進化歷史,並在篩選階段剔除 benchmark-specific 改動和落在噪聲範圍內的漲分。
因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。
OpenAI 新平台發布系列首篇隨筆《永恆的互補》,作者為 Hemanth Asirvatham 與 Elliott Mokski,文末註明觀點不代表 OpenAI。文章引用 Nick Bloom 等研究:維持摩爾定律所需研究人員數量是 1970 年代初的 18 倍以上,1930 年代以來全經濟有效研究投入增長 23 倍,而研究生產率下降 41 倍。作者據此提出「制度智慧」概念,認為前沿智慧與執行能力互為補充,超級智慧的價值可能更多體現在重複性執行工作上。
OpenRSI Index 正式發布,這是一個用真實開源研究專案出題、檢驗科研智慧體能否改進人類訓練方案的評測基準。任務取自 Marin、Qwen、GPIC 等專案,覆蓋預訓練、後訓練與影像生成,單次執行算力從 5,815 到 20,864 H100·小時。智慧體在工作區反覆實驗,提交後凍結快照交由獨立評測環境驗收,原作者方案在同一環境重跑作為對照,篡改獎勵、洩露評測資訊或超預算計零分。
星動紀元自研世界動作模型 VPP2 登頂 RoboDojo 模擬榜單,平均成功率 32.26%、平均得分 39.26 分雙第一,高於 GPT-6-Astra 的 22.48% 和 28.97 分,泛化、精細操作、記憶三項同樣居首。真機 ALOHA 雙臂零樣本 10 類任務平均成功率 58.5%,9 類最佳,高於π0.5 的 40%。該模型未使用額外資料或 Agent RSI 等增強手段,靠三階段訓練解耦影片預測與動作學習,程式碼與專案主頁已開源。
輝達在 2026 年 6 月推出 Nvidia Halos for Robotics,把面向自動駕駛的 Halos 安全架構擴充套件到機器人領域。Halos 於 2025 年發布,用硬體和軟體工具幫開發者為自動駕駛汽車等自主系統設定安全護欄,機器人版則覆蓋倉庫自主移動機器人、工廠內人形機器人乃至手術機器人。輝達機器人生態與邊緣計算負責人 Amit Goel 表示,隨著 AI 模型與機器人硬體能力提升,安全被視為下一個瓶頸。