AISpot

搜尋

找到 7 筆

r/LocalLLaMA top of the day10/3 12:47AI 評分38

LocalLLaMA 討論:大模型用 IQ1_S 量化到底行不行

r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。

機器之心● 精選10/5 12:40AI 評分72

新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半

VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。

Kimi blog● 精選10/2 22:11AI 評分70

Kimi 團隊發布 WorldVQA 多模態視覺知識基準

Kimi 團隊開源 WorldVQA 基準,用於測量多模態大模型的視覺世界知識事實正確性,包含 3500 組影像問答對,覆蓋 9 個類別,中文佔 36%、英文佔 64%。結果顯示前沿模型在長尾視覺知識上準確率常低於 50%,且普遍過度自信,表現最好的 Kimi-K2.5 校準誤差 ECE 仍達 37.9%、Slope 為 0.550。資料集與評測指令碼已開源。

Kimi blog● 精選10/2 22:11AI 評分75

Kimi 發布 PerceptionBench,16 個前沿多模態模型準確率均不足 60%

Kimi Team 發布 PerceptionBench,從 42 個基準的模型失敗案例中歸納出 10 類原子視覺感知能力,建置 3000 道經人工驗證的題目,每題只考感知、不需推理或外部知識。在 16 個前沿多模態大模型上,沒有模型準確率達到 60%,感知相關幻覺平均表現最差;總分接近的模型在實際感知內容上也可能差異明顯。