AISpot

搜尋

找到 3 筆;也可以試試 語意搜尋

機器之心● 精選10/7 08:35AI 評分73

哈工大深圳與 NUS 提出 QuantWM,2-bit KV Cache 壓縮 6.2 倍

哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。

量子位● 精選10/9 03:11AI 評分81

位元組 Seed 發現 DeepSeek-V4 準確率隨輸入位置週期性波動

位元組 Seed 團隊發現,DeepSeek-V4 系列在 128K 長上下文檢索中的準確率會隨目標資訊的位置以 4 個 Token 為週期起伏,同一條資訊換個位置最多相差 40.2 個百分點,V4-Pro-Base 也有 34.8 個百分點。原因指向其為省記憶體採用的分塊 KV Cache 壓縮:資訊在壓縮視窗內所處相位不同,檢索能力就出現系統性差異,團隊稱之為相位敏感性,並用基於 Qwen3-0.6B 自訓的多種分塊壓縮模型復現了同樣的週期。