OpenRouter announcements8/21 01:00AI 評分36
OpenRouter 發布 Visual Image Benchmarks 影像基準
該基準用七類挑戰性提示詞測試影像模型能力,覆蓋其提供的 39 個模型,結果以網格展示並可按價格和生成時間排序。
找到 2 筆
該基準用七類挑戰性提示詞測試影像模型能力,覆蓋其提供的 39 個模型,結果以網格展示並可按價格和生成時間排序。
Kimi 團隊發布 WorldVQA 基準,用 3500 組圖文問答、9 個類別評測多模態大模型的視覺世界知識,並區分常見與長尾知識。前沿模型在長尾視覺知識上準確率常低於 50%。所有被測模型都過度自信,表現最好的 Kimi-K2.5 的 ECE 為 37.9%、Slope 為 0.550;資料集與評測指令碼已開源。