AISpot

新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半

機器之心10/5 12:40官方公告研究開源

VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。

首次把空間智慧放進觀察—推理—行動—修正的閉環評測,用 280 個物理驗證場景量化 12 個主流多模態模型從看懂到做對之間的成功率落差,對做具身智慧與機器人操作的研究者最有參考價值。

原標題:看懂不等于做对:VA-Bench测出大模型空间智能的执行断层
閱讀原文

評分70 / 75(平均 72,門檻 65)
狀態精選

相關報導

r/LocalLLaMA top of the day10/3 07:49AI 評分68

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

r/LocalLLaMA top of the day10/3 00:18AI 評分27

LocalLLaMA 討論 jev 分類模型的實際使用體驗

r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。

Hacker News front page10/4 13:51AI 評分62

Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行

開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。

r/LocalLLaMA top of the day10/3 01:00AI 評分72

宇樹發布 6B 人形機器人模型 UnifoLM-WLA-1.0

宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,引數 6B,用約 2500 小時真實機器人資料訓練,單個模型可完成 64 項任務(10 項全身 + 54 項桌面),並支援平行夾爪與兩種靈巧手。架構上以基於 Qwen3-VL 的具身推理器 UnifoLM-ER-1 為起點,加入光流與 VQ-VAE 的未來動態區域預測、殘差 VQ 動作離散化,以及 MMDiT 動作專家做連續控制。演示在宇樹 G1 上完成鋪床、裝洗衣機、疊衣服、物體分揀等操作。

機器之心● 精選10/4 12:12AI 評分68

Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路

TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。