阿里發布 Qwen-Drive-1.0 自動駕駛視覺語言基礎模型
阿里推出 Qwen-Drive-1.0,稱其為首個在預訓練階段統一 3D 感知與視覺問答、並擴充套件至運動規劃的自動駕駛視覺語言基礎模型,且不改動預訓練 VLM 架構。模型基於原生多模態的 Qwen3.5-4B,外掛 BEV 感知頭(3D 檢測、語義佔用預測、BEV 地圖分割)與用流匹配生成 5 秒軌跡的 Planning Expert。訓練僅用公開資料共 283 萬樣本,駕駛 QA 平均分 69.43,WOD-E2E 開環 ADE 5s 達 1.27/2.65。
首個在預訓練階段統一 3D 感知、駕駛問答與運動規劃且不改 VLM 架構的自動駕駛基礎模型,附完整基準對比與 283 萬公開樣本訓練細節,對自動駕駛與多模態研究者有參考價值。
原標題:Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
閱讀原文
| 評分 | 82 / 78(平均 80,門檻 60) |
|---|---|
| 狀態 | 精選(舊聞,已歸檔) |