DeepSeek V4.1-Flash 將 KV cache 壓縮至前代四分之一
DeepSeek 公布 V4.1-Flash 的 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
找到 8 筆
DeepSeek 公布 V4.1-Flash 的 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。
llama.cpp 發布 b11411,修復恢復 KV cache 時 rotation 後設資料不匹配的問題:現在會儲存精確的 rotation 後設資料,並拒絕恢復與之不匹配的快取。原先的 state rotation 測試被移入 test-save-load-state,納入儲存/載入測試矩陣,對所有受測模型執行,並探測模型支援的 KV cache 型別組合,不使用 attention rotation 的模型視為空通過。
llama.cpp 的 Hexagon 後端在 row-split 多核模式下把 flash_attn 從按 Q token 切分改為按 KV head 切分,讓每個核心只讀自己負責的那部分 KV cache,不再重複讀取全部 KV cache。該行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制,預設開啟;當 n_kv_heads 不能被核心數整除時回退到原 token-block 切分(如 4 核上只有 2 個 KV head 的 Gemma-4)。
llama.cpp 合併 PR #29994,修復 CPU 後端在共享序列(seq_cp)場景下 k-pool 的散射寫入資料競爭:多個共享同一 cell 的序列會從不同 scatter 條目寫同一 rep 行。
DeepSeek 上線 V4.1-Flash,採用 552B 引數 MoE 與新的因果編解碼架構,輸入僅 8B、輸出 16B 啟用引數,原生支援視覺理解。官方稱其基準成績超過旗艦 V4-Pro,KV cache 只需上代 1/4 的 HBM 和 1/8 的 SSD 儲存。
斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。
阿里開源 Qwen-Image-2.1,將文生圖與影像編輯統一到單一模型,視覺生成元件僅 7B 引數,原生支援生成和編輯透明影像。該模型最多可接受 10 張參考圖,支援圈選、塗抹和獨立掩碼三種區域性編輯方式,並提升人像身份與商品一致性。採用混合粒度注意力架構,KV cache 複用輸入影像與編輯指令以降低視訊記憶體佔用,權重已在 GitHub、Hugging Face 和 ModelScope 發布。