LocalLLaMA 討論:大模型用 IQ1_S 量化到底行不行
r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。
找到 7 筆
r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。
Reddit 的 r/LocalLLaMA 版塊一則帖子下,使用者討論用低成本硬體本地跑大模型。有人稱 2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器最省錢,可讓 Qwen 3.8 Flash 跑到 15 tok/s 以上;也有人表示雙 7900XTX 不到 2000 美元即可支援 27B Q8 模型超過 220k 上下文。
馬斯克在 X 上表示,Grok @Bot 會採用對使用者效果最好的方案:簡單問題路由給小型、快速的模型,答案複雜的問題則交給大型模型。他沒有說明具體呼叫哪些模型、複雜度如何判定,也未給出上線時間。
曾為 OpenAI 每次重大模型發布撰寫安全報告的 David Robinson 本週辭職,並在 The Atlantic 發表評論文章發出警告。他認為行業文化已從根本上崩壞,問題比簡單增加幾條訓練模型的新規更深層。相關報導由 The Verge 刊出。
Kimi 團隊開源 WorldVQA 基準,用於測量多模態大模型的視覺世界知識事實正確性,包含 3500 組影像問答對,覆蓋 9 個類別,中文佔 36%、英文佔 64%。結果顯示前沿模型在長尾視覺知識上準確率常低於 50%,且普遍過度自信,表現最好的 Kimi-K2.5 校準誤差 ECE 仍達 37.9%、Slope 為 0.550。資料集與評測指令碼已開源。
Kimi Team 發布 PerceptionBench,從 42 個基準的模型失敗案例中歸納出 10 類原子視覺感知能力,建置 3000 道經人工驗證的題目,每題只考感知、不需推理或外部知識。在 16 個前沿多模態大模型上,沒有模型準確率達到 60%,感知相關幻覺平均表現最差;總分接近的模型在實際感知內容上也可能差異明顯。