輝達 Physis-Lang 登頂 Physics-IQ Verified,用物理語言描述提升影片生成
輝達聯合 MIT 與牛津大學提出的 Physis-Lang,把物理原因、規律和結果寫進影片文字描述,並貫穿資料篩選、模型訓練與影片生成。其 Cosmos3-Super 與 Cosmos3-Nano 在 Physics-IQ Verified 榜單以 48.2 和 43.3 分列前二,Super 較此前最高分高出 5.5 個百分點。基於 Cosmos3-Nano 的版本在論文四項物理 benchmark 上取得開源最佳,三項總分超過 Veo 3.1。
僅靠語言側的物理描述自進化,就把 PhyGenBench 生成分從 64.17 提到 67.29,並登頂 Physics-IQ Verified,對影片生成與世界模型研究者最有用。
原標題:让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性
閱讀原文
| 評分 | 78 / 78(平均 78,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
Einsia 發布物理世界模型評測:Seedance 2.5 最高 57.76 分
Einsia AI 旗下 Navers Lab 發布 World Models' Last Exam in Physics,用 40 個任務、9 類物理現象測試 8 個影片生成模型,Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。評分由一致性分 C 與物理分 P 組成,物理分靠程式從影片中測量軌跡、週期、角度等量再按物理關係計算,且只有 C≥80 才計入總分。
輝達展示 GPT-6 Astra 等模型驅動 Omniverse 模擬開發
NVIDIA 發布一批案例,展示開發者用 GPT-6 Astra、Claude Fable 5 等前沿模型驅動 Omniverse 庫完成模擬開發。開發者以自然語言下指令,由模型連線 ovphysx 物理、ovrtx 渲染與感測器模擬等庫,再人工稽核並逐步修正結果。
8B 智慧體自主呼叫工具做影片生成,VABench 從 56.5 升到 86.1
VideoGen-Agent 用 Qwen3-VL-8B-Instruct 做基座,在多輪互動中呼叫檢索、生成與驗證工具,先以 16K 教師軌跡監督微調,再用 8K 提示做多工強化學習。在 600 條提示的 VABench 上,Toolset 1 配置得 75.6 分,比基礎生成器 56.5 分高出 19.1 分;智慧體策略不變、僅升級生成工具後達 86.1 分,人類評估中 84.3% 的判斷偏好該配置。
Qwen3.8 27B 在 DGX Spark 復現文字加法實驗,169 題答對 167
有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。
Ninfer 4080 讓 16GB 顯示卡跑 100k 上下文
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。