llama.cpp releases10/5 08:34AI 評分56
llama.cpp 為 SpacemiT X60 補上 Q8_0 IME1 核心
llama.cpp 合併 PR #28479,為 SpacemiT X60 新增 Q8_0 的 IME1 矩陣核心與 repack 路徑。此前該平台 IME 加速只覆蓋 Q4_0/Q4_1/Q4_K,且建置時 GGML_CPU_REPACK=OFF,Q8_0 無加速路徑,prefill 比 Q4_0 慢約十倍。
依意思最接近的 3 筆
llama.cpp 合併 PR #28479,為 SpacemiT X60 新增 Q8_0 的 IME1 矩陣核心與 repack 路徑。此前該平台 IME 加速只覆蓋 Q4_0/Q4_1/Q4_K,且建置時 GGML_CPU_REPACK=OFF,Q8_0 無加速路徑,prefill 比 Q4_0 慢約十倍。
llama.cpp 合併 PR #29639,為 Vulkan 後端加入針對量化 K/V 快取的稀疏 Flash Attention,並把稀疏 FA 的索引壓縮改為單次掃描。原實現每行 mask 用一個 workgroup、按 BLOCK_SIZE 分塊各做一次掃描,解碼時單個 workgroup 要跑 KV/1024 次受 barrier 限制的迭代,128k 單元格下開銷超過它服務的稀疏注意力本身。
Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯而非執行時崩潰。它要求跨記憶體空間的資料移動顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期據此接受或拒絕放置方案。