AISpot

搜尋

找到 2 筆;也可以試試 語意搜尋

機器之心● 精選10/4 12:12AI 評分68

Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路

TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。

Kimi blog● 精選10/2 22:11AI 評分70

Kimi 團隊發布 WorldVQA 多模態視覺知識基準

Kimi 團隊開源 WorldVQA 基準,用於測量多模態大模型的視覺世界知識事實正確性,包含 3500 組影像問答對,覆蓋 9 個類別,中文佔 36%、英文佔 64%。結果顯示前沿模型在長尾視覺知識上準確率常低於 50%,且普遍過度自信,表現最好的 Kimi-K2.5 校準誤差 ECE 仍達 37.9%、Slope 為 0.550。資料集與評測指令碼已開源。