OpenRSI Index 上線:讓智慧體改進 Qwen、Marin 等開源訓練方案
OpenRSI Index 正式發布,這是一個用真實開源研究專案出題、檢驗科研智慧體能否改進人類訓練方案的評測基準。任務取自 Marin、Qwen、GPIC 等專案,覆蓋預訓練、後訓練與影像生成,單次執行算力從 5,815 到 20,864 H100·小時。智慧體在工作區反覆實驗,提交後凍結快照交由獨立評測環境驗收,原作者方案在同一環境重跑作為對照,篡改獎勵、洩露評測資訊或超預算計零分。
把科研智慧體評測推到單次數千至上萬 H100·小時,並公開任務、獨立驗收機制與實驗軌跡,為做預訓練、後訓練及關注遞迴自我改進的研究者提供可複用基準。
原標題:从「刷榜」到「做科研」:研究员还有多久被 AI超越?
閱讀原文
| 評分 | 68 / 68(平均 68,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
OpenAI 將 RSI 列為戰略目標,MemoraX 展示記憶驅動自進化
OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。
Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
Google 等提出 RRSI,給 Agent 自進化加正則化
Google 等提出 RRSI,用正則化約束 Agent Harness 的遞迴自我改進(RSI):不鎖死自我修改能力,而是限制每輪同時修改的機制數量、保留進化歷史,並在篩選階段剔除 benchmark-specific 改動和落在噪聲範圍內的漲分。
華人團隊 Novix 將 RSI 規模化,半年服務 20 萬專家
華人團隊 Novix 把 RSI(遞迴自我改進)做成規模化閉環,成立半年已服務 20 萬名專家,覆蓋 40 多個國家和地區、500 多所高校及科研機構。團隊由石宇、湯嘉斌等創立,核心成員來自 Google、微軟、Meta、智譜和 Kimi。
OpenRouter 發布 Model Router Benchmarks 對比頁
OpenRouter 於 2026 年 10 月 2 日上線 Model Router Benchmarks 頁面,用品質、速度、成本三個維度對多家模型路由器打分,並給出 0 到 10 的 Router Index 綜合分,預設權重為品質 60%、單任務耗時 20%、成本 20%,使用者可拖動滑塊調整。