AISpot

哈工大深圳與 NUS 提出 QuantWM,2-bit KV Cache 壓縮 6.2 倍

機器之心10/7 13:35新聞報導研究

哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。

揭示了影片世界模型 2-bit KV Cache 量化中評測分數掩蓋視覺退化的問題,給出免訓練修復方案與最高 6.20 倍壓縮的實測資料,對做長影片生成、受視訊記憶體限制的開發者有參考價值。

原標題:量化后画面闪烁?时序稳定的视频世界模型2-bit KV Cache压缩方案诞生
閱讀原文

評分76 / 70(平均 73,門檻 65)
狀態精選

相關報導

llama.cpp releases10/5 09:37AI 評分59

llama.cpp Vulkan 後端加入量化 K/V 稀疏 Flash Attention

llama.cpp 合併 PR #29639,為 Vulkan 後端加入針對量化 K/V 快取的稀疏 Flash Attention,並把稀疏 FA 的索引壓縮改為單次掃描。原實現每行 mask 用一個 workgroup、按 BLOCK_SIZE 分塊各做一次掃描,解碼時單個 workgroup 要跑 KV/1024 次受 barrier 限制的迭代,128k 單元格下開銷超過它服務的稀疏注意力本身。

r/LocalLLaMA top of the day10/3 12:47AI 評分38

LocalLLaMA 討論:大模型用 IQ1_S 量化到底行不行

r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。

r/LocalLLaMA top of the day10/3 07:18AI 評分70

llama.cpp 新 PR 將 Qwen4 索引器視訊記憶體減半

llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。

llama.cpp releases● 精選10/5 16:55AI 評分68

llama.cpp Hexagon 的 flash_attn 改為按 KV 頭切分

llama.cpp 的 Hexagon 後端在 row-split 多核模式下把 flash_attn 從按 Q token 切分改為按 KV head 切分,讓每個核心只讀自己負責的那部分 KV cache,不再重複讀取全部 KV cache。該行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制,預設開啟;當 n_kv_heads 不能被核心數整除時回退到原 token-block 切分(如 4 核上只有 2 個 KV head 的 Gemma-4)。