AISpot

搜尋

依意思最接近的 3 筆

llama.cpp releases10/5 09:37AI 評分59

llama.cpp Vulkan 後端加入量化 K/V 稀疏 Flash Attention

llama.cpp 合併 PR #29639,為 Vulkan 後端加入針對量化 K/V 快取的稀疏 Flash Attention,並把稀疏 FA 的索引壓縮改為單次掃描。原實現每行 mask 用一個 workgroup、按 BLOCK_SIZE 分塊各做一次掃描,解碼時單個 workgroup 要跑 KV/1024 次受 barrier 限制的迭代,128k 單元格下開銷超過它服務的稀疏注意力本身。

Hacker News front page10/3 18:23AI 評分68

Vx 發布:把 CPU、GPU、NPU 記憶體寫進型別系統的程式語言

Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯而非執行時崩潰。它要求跨記憶體空間的資料移動顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期據此接受或拒絕放置方案。