OpenWAM:可組合世界-動作模型的開放框架
OpenWAM 是一個面向世界-動作模型的開放框架,讓影片預測與動作生成按不同順序組合,也能把獨立訓練的影片預測器、逆動力學模型(IDM)與前向動力學模型(FDM)在推理時拼接。它基於 Wan2.2-5B 適配機器人影片,在約 334 萬條軌跡、14640 小時影片上預訓練,用 32 張 NVIDIA B200 訓練 14 天,再以 5B 影片專家加 2B 動作專家組成 MoT 架構加入控制。
把世界-動作模型的生成順序與模組拼接做成可配置的公開框架,並披露 334 萬條軌跡的預訓練與反事實資料建置細節,對做機器人策略與影片預測的研究者最有用。
原標題:OpenWAM: An Open Framework for Composable World-Action Models
閱讀原文
| 評分 | 78 / 76(平均 77,門檻 76) |
|---|---|
| 狀態 | 精選 |
相關報導
宇樹發布 6B 人形機器人模型 UnifoLM-WLA-1.0
宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,引數 6B,用約 2500 小時真實機器人資料訓練,單個模型可完成 64 項任務(10 項全身 + 54 項桌面),並支援平行夾爪與兩種靈巧手。架構上以基於 Qwen3-VL 的具身推理器 UnifoLM-ER-1 為起點,加入光流與 VQ-VAE 的未來動態區域預測、殘差 VQ 動作離散化,以及 MMDiT 動作專家做連續控制。演示在宇樹 G1 上完成鋪床、裝洗衣機、疊衣服、物體分揀等操作。
新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。
Reflection 發布首個開放權重模型 Beam:501B 總引數、23B 啟用
Reflection 發布首個開放權重模型 Beam:稀疏 MoE,總引數 501B、啟用 23B,面向程式設計、推理與 agentic 負載。預訓練使用 23.8 萬億 token,RL 階段動用 10.5K 塊 NVIDIA GB300 訓練 4 周、生成超 1 億條 rollout、約 13 億個沙箱,官方稱是開放實驗室中規模最大的 RL 訓練之一。評測中其與 GLM 5.2 相當但推理算力少 3–4 倍,接近 Qwen 3.8-Max,原始能力仍落後 Kimi K3;
OpenCode v1.18.35 發布:修復 xAI 工具結果圖片傳遞
OpenCode 發布 v1.18.35,核心改進是新增 canonical redirects,並提供 JSON 與 Markdown 兩種格式的 agent 可讀統計資料。本次修復讓 xAI 的工具呼叫結果可以攜帶受支援的圖片,不支援的圖片格式會被跳過,做法是把 @ai-sdk/xai 升級到 3.0.139。文件方面,Zen 文件新增 Fledge Alpha Free,生態外掛列表加入 opencode-supabase,該版本同時致謝 3 位社群貢獻者。
Anyworld:本地 LLM 當 DM 的自託管多人文字 RPG
Anyworld 是一款瀏覽器端多人文字冒險遊戲,由房主用 llama.cpp 本地跑模型充當 DM,也支援 OpenAI 等雲 API,玩家只需開啟連結即可加入。行動結果由 Python 真實擲骰決定,模型只負責敘述;支援自訂劇本、隱藏劇情觸發、場外聊天和斷線重連。開發時用 Gemma 4-26B-A4B Q4、128k 上下文,在 RTX 5070 Ti 16GB 上每輪結算約 5 秒。