Kimi blog● 精選10/2 22:11AI 評分65
Kimi Team 發布 PerceptionBench 視覺感知基準
Kimi Team 發布 PerceptionBench,把視覺感知拆成 10 個原子能力,包含 3,000 道驗證題。16 個前沿 MLLM 無一達到 60% 準確率,感知相關幻覺平均最弱。
找到 5 筆
Kimi Team 發布 PerceptionBench,把視覺感知拆成 10 個原子能力,包含 3,000 道驗證題。16 個前沿 MLLM 無一達到 60% 準確率,感知相關幻覺平均最弱。
該基準用七類挑戰性提示詞測試影像模型能力,覆蓋其提供的 39 個模型,結果以網格展示並可按價格和生成時間排序。
OpenRouter 推出 Model Router Benchmarks 頁面,用多領域基準給各家模型路由器打質量、速度、成本分。頁面用 Router Index 把三項合成 0 到 10 分,預設權重質量 60%、單任務耗時 20%、成本 20%,可拖滑塊調整。列出的路由器都能在 OpenRouter 上直接替換模型試用。
NVIDIA 發布開源表格基礎模型 Kumo Tabular,28M 至 215M 三檔引數,OpenMDW-1.1 許可可商用。它在 TabArena、BeyondArena、TALENT、ScoringBench 四個基準排名第一。給定帶標籤的表格,單次前向即輸出分類機率或迴歸數值,無需訓練、調參和特徵工程。
Kimi 團隊發布 WorldVQA 基準,用 3500 組圖文問答、9 個類別評測多模態大模型的視覺世界知識,並區分常見與長尾知識。前沿模型在長尾視覺知識上準確率常低於 50%。所有被測模型都過度自信,表現最好的 Kimi-K2.5 的 ECE 為 37.9%、Slope 為 0.550;資料集與評測指令碼已開源。