AISpot

OpenRSI Index 上線:讓智慧體改進 Qwen、Marin 等開源訓練方案

機器之心新聞報導研究開源

OpenRSI Index 正式發布,這是一個用真實開源研究專案出題、檢驗科研智慧體能否改進人類訓練方案的評測基準。任務取自 Marin、Qwen、GPIC 等專案,覆蓋預訓練、後訓練與影像生成,單次執行算力從 5,815 到 20,864 H100·小時。智慧體在工作區反覆實驗,提交後凍結快照交由獨立評測環境驗收,原作者方案在同一環境重跑作為對照,篡改獎勵、洩露評測資訊或超預算計零分。

把科研智慧體評測推到單次數千至上萬 H100·小時,並公開任務、獨立驗收機制與實驗軌跡,為做預訓練、後訓練及關注遞迴自我改進的研究者提供可複用基準。

原標題:从「刷榜」到「做科研」:研究员还有多久被 AI超越?
閱讀原文

評分68 / 68(平均 68,門檻 65)
狀態精選

相關報導

機器之心AI 評分42

OpenAI 將 RSI 列為戰略目標,MemoraX 展示記憶驅動自進化

OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。

量子位● 精選AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。