清華系星動紀元 VPP2 登頂 RoboDojo 模擬榜單
星動紀元自研世界動作模型 VPP2 登頂 RoboDojo 模擬榜單,平均成功率 32.26%、平均得分 39.26 分雙第一,高於 GPT-6-Astra 的 22.48% 和 28.97 分,泛化、精細操作、記憶三項同樣居首。真機 ALOHA 雙臂零樣本 10 類任務平均成功率 58.5%,9 類最佳,高於π0.5 的 40%。該模型未使用額外資料或 Agent RSI 等增強手段,靠三階段訓練解耦影片預測與動作學習,程式碼與專案主頁已開源。
以標準資料集在 42 項雙臂任務的評測中壓過 GPT-6-Astra 與輝達 GR00T,14B 引數反超 64B 基線,並給出真機零樣本與開原始碼,可供具身智慧研究者復現驗證。
原標題:清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据
閱讀原文
| 評分 | 78 / 78(平均 78,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。
六款 AI 決策模型吃豆人對戰,基準與排行榜開源
有人讓 jev 1.13、kev、clef、clef flash、GPT-6 Luna 和 Laya 六款低延遲決策模型玩吃豆人對抗機器人鬼魂,每個模型各跑 100 局,並公布了排行榜。測試倉庫已開源,任何人都能接入自己的模型加入排名。這些模型通過其創業公司 opper 執行,一局成本約 2 美分,併為所有人提供免費試用額度。讀者也能自己扮演吃豆人、由模型當鬼魂,作者稱打破 jev 的高分出乎意料地難。
白澤通境發布溯因式世界模型 AWM,2bit 量化跑進機器人端側
中科大系公司白澤通境發布溯因式世界模型 AWM,並開源論文與程式碼,配合自研端側推理引擎 BAIZ-RUN 把模型壓進機器人本地執行。AWM 從無標註影片學習,在 Push-T 任務上以 2000 條軌跡達到 75% 成功率,約為 Causal-JEPA 所需資料的七分之一,資料加到 14728 條時成功率約 92%。
宇樹發布 6B 人形機器人模型 UnifoLM-WLA-1.0
宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,引數 6B,用約 2500 小時真實機器人資料訓練,單個模型可完成 64 項任務(10 項全身 + 54 項桌面),並支援平行夾爪與兩種靈巧手。架構上以基於 Qwen3-VL 的具身推理器 UnifoLM-ER-1 為起點,加入光流與 VQ-VAE 的未來動態區域預測、殘差 VQ 動作離散化,以及 MMDiT 動作專家做連續控制。演示在宇樹 G1 上完成鋪床、裝洗衣機、疊衣服、物體分揀等操作。
UniEvo-VL:多模態模型自蒸餾自我進化訓練配方
arXiv 上提交的 UniEvo-VL 提出一種 on-policy 自蒸餾訓練方法:讓同一個多模態模型分別以學生和教師身份出現,學生只看原始問題,教師額外看到自我批評作為特權資訊,訓練目標是縮小兩者在取樣軌跡上去噪擴散分佈的差異,無需依賴更大的外部教師模型。基於開源 Qwen-image-2512,GenEval 從 0.747 升至 0.808,GenEval2 Soft-TIFA 從 32.97 升至 35.53。