AISpot

LIBERO-MAX 評測機器人執行中途的環境變化,成功率最多降 25.7 個百分點

機器之心官方公告研究開源

斯坦福、CMU、MIT 等機構的研究者發布機器人評測基準 LIBERO-MAX,專門檢驗機器人在任務執行途中遭遇環境變化後能否繼續完成,論文入選 NeurIPS'26 Robotics World Modeling Workshop 口頭報告。它用共享初始狀態、指令與隨機種子的配對執行,建置 8,000 組案例和 8 類中途變化,涵蓋目標移動、容器移動、相機視角改變、感測器噪聲等;

首次把環境變化放在執行中途做配對評測,用 22.4 萬次模擬量化 14 種策略 11–25.7 個百分點的成功率下降,並驗證補償模組能否挽回失敗,對機器人策略與魯棒性評測方向的研究者最有用。

原標題:机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性
閱讀原文

評分68 / 70(平均 69,門檻 65)
狀態精選

相關報導

機器之心● 精選AI 評分72

新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半

VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。

機器之心● 精選AI 評分75

ROMA 讓機器人主動互動探索物體,7B 模型比肩 GPT-6 Astra

人大高瓴 GeWu-Lab、智源研究院等提出 ROMA 系統,讓多感測器機器人主動與物體互動來補全物理理解,其 ROMA-7B 模型在 ROMA Bench 的 2100 道題上取得 72.9% 成功率,整體與 GPT-6 Astra 持平,並超過 GPT-5.4 與 Gemini 3.5 Flash。該工作同時開源了覆蓋近 2000 個真實物體、視聽觸力四模態同步採集的互動資料集 ROMI-2K,以及包含單鏈、多鏈和意圖驅動三類任務的評測基準。

機器之心● 精選AI 評分70

Sergey Levine:機器人硬體已夠好,難點在決策與資料順序

Sergey Levine 在播客 The Peterman Pod 中表示,機器人硬體已「足夠好」,當前最大挑戰是建立讓機器人理解外部世界的決策迴圈,而非控制身體。他認為正確順序是先積累紮實的具身經驗,再接入影片等其他來源資料,與先用網際網路影片訓練的路線相反;機器人對可靠性的要求高於大語言模型,強化學習尚未解決從 95% 到 100% 的最後一步。

量子位● 精選AI 評分81

PaperBenchX 發布:GPT-6 Astra 完整復現率僅 13.98%

UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。

機器之心● 精選AI 評分68

OpenRSI Index 上線:讓智慧體改進 Qwen、Marin 等開源訓練方案

OpenRSI Index 正式發布,這是一個用真實開源研究專案出題、檢驗科研智慧體能否改進人類訓練方案的評測基準。任務取自 Marin、Qwen、GPIC 等專案,覆蓋預訓練、後訓練與影像生成,單次執行算力從 5,815 到 20,864 H100·小時。智慧體在工作區反覆實驗,提交後凍結快照交由獨立評測環境驗收,原作者方案在同一環境重跑作為對照,篡改獎勵、洩露評測資訊或超預算計零分。