AISpot

搜尋

找到 8 筆

機器之心● 精選10/7 13:35AI 評分73

哈工大深圳與 NUS 提出 QuantWM,2-bit KV Cache 壓縮 6.2 倍

哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。

llama.cpp releases10/5 11:08AI 評分47

llama.cpp b11411 修復 KV cache 旋轉後設資料不匹配問題

llama.cpp 發布 b11411,修復恢復 KV cache 時 rotation 後設資料不匹配的問題:現在會儲存精確的 rotation 後設資料,並拒絕恢復與之不匹配的快取。原先的 state rotation 測試被移入 test-save-load-state,納入儲存/載入測試矩陣,對所有受測模型執行,並探測模型支援的 KV cache 型別組合,不使用 attention rotation 的模型視為空通過。

llama.cpp releases● 精選10/5 16:55AI 評分68

llama.cpp Hexagon 的 flash_attn 改為按 KV 頭切分

llama.cpp 的 Hexagon 後端在 row-split 多核模式下把 flash_attn 從按 Q token 切分改為按 KV head 切分,讓每個核心只讀自己負責的那部分 KV cache,不再重複讀取全部 KV cache。該行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制,預設開啟;當 n_kv_heads 不能被核心數整除時回退到原 token-block 切分(如 4 核上只有 2 個 KV head 的 Gemma-4)。

Hacker News front page10/4 20:42AI 評分72

斯坦福 Ousterhout 提出 Homa 協議替代 TCP

斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。

Qwen blog● 精選9/20 13:00AI 評分80

阿里開源 Qwen-Image-2.1,7B 引數統一生成與編輯

阿里開源 Qwen-Image-2.1,將文生圖與影像編輯統一到單一模型,視覺生成元件僅 7B 引數,原生支援生成和編輯透明影像。該模型最多可接受 10 張參考圖,支援圈選、塗抹和獨立掩碼三種區域性編輯方式,並提升人像身份與商品一致性。採用混合粒度注意力架構,KV cache 複用輸入影像與編輯指令以降低視訊記憶體佔用,權重已在 GitHub、Hugging Face 和 ModelScope 發布。