AISpot

輝達 Physis-Lang 登頂 Physics-IQ Verified,用物理語言描述提升影片生成

機器之心10/9 05:38新聞報導研究模型

輝達聯合 MIT 與牛津大學提出的 Physis-Lang,把物理原因、規律和結果寫進影片文字描述,並貫穿資料篩選、模型訓練與影片生成。其 Cosmos3-Super 與 Cosmos3-Nano 在 Physics-IQ Verified 榜單以 48.2 和 43.3 分列前二,Super 較此前最高分高出 5.5 個百分點。基於 Cosmos3-Nano 的版本在論文四項物理 benchmark 上取得開源最佳,三項總分超過 Veo 3.1。

僅靠語言側的物理描述自進化,就把 PhyGenBench 生成分從 64.17 提到 67.29,並登頂 Physics-IQ Verified,對影片生成與世界模型研究者最有用。

原標題:让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性
閱讀原文

評分78 / 78(平均 78,門檻 65)
狀態精選

相關報導

機器之心● 精選10/8 04:24AI 評分75

Einsia 發布物理世界模型評測:Seedance 2.5 最高 57.76 分

Einsia AI 旗下 Navers Lab 發布 World Models' Last Exam in Physics,用 40 個任務、9 類物理現象測試 8 個影片生成模型,Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。評分由一致性分 C 與物理分 P 組成,物理分靠程式從影片中測量軌跡、週期、角度等量再按物理關係計算,且只有 C≥80 才計入總分。

機器之心● 精選10/8 22:40AI 評分78

8B 智慧體自主呼叫工具做影片生成,VABench 從 56.5 升到 86.1

VideoGen-Agent 用 Qwen3-VL-8B-Instruct 做基座,在多輪互動中呼叫檢索、生成與驗證工具,先以 16K 教師軌跡監督微調,再用 8K 提示做多工強化學習。在 600 條提示的 VABench 上,Toolset 1 配置得 75.6 分,比基礎生成器 56.5 分高出 19.1 分;智慧體策略不變、僅升級生成工具後達 86.1 分,人類評估中 84.3% 的判斷偏好該配置。

Simon Willison● 精選10/4 19:34AI 評分66

Qwen3.8 27B 在 DGX Spark 復現文字加法實驗,169 題答對 167

有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。