llama.cpp 為 Hexagon NPU 支援 Q4_K/Q6_K tiled GET_ROWS
llama.cpp 的 Hexagon 後端新增 tiled Q4_K 與 Q6_K 的 GET_ROWS 支援,使驍龍 Hexagon NPU 能對這兩種量化格式執行嵌入查表,同一提交還修正了 Q4_K 檢視的校驗邏輯。改動由 OpenCode 協助完成,已隨本次建置發布,覆蓋 Android arm64 與 Linux arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合包。
原標題:b11487
閱讀原文
| 評分 | 45 / 38(平均 41,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 為 Hexagon NPU 增加 q2_k 與 q3_k 量化支援
llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。
llama.cpp b11489 加速 Hexagon NPU 的 Q6_K 權重反量化
llama.cpp 發布 b11489,為 Hexagon NPU 的 Q6_K 權重反量化帶來加速,做法是再增加 2 倍迴圈展開,改動由 OpenCode 協助完成。該版本繼續提供 macOS/iOS、Linux、Android、Windows 多平台預編譯包,Snapdragon 版本可分別使用 CPU、Adreno GPU 與 Hexagon NPU,Windows arm64 另有 OpenCL Adreno 建置;
llama.cpp Hexagon 的 flash_attn 改為按 KV 頭切分
llama.cpp 的 Hexagon 後端在 row-split 多核模式下把 flash_attn 從按 Q token 切分改為按 KV head 切分,讓每個核心只讀自己負責的那部分 KV cache,不再重複讀取全部 KV cache。該行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制,預設開啟;當 n_kv_heads 不能被核心數整除時回退到原 token-block 切分(如 4 核上只有 2 個 KV head 的 Gemma-4)。
llama.cpp b11486 改進 Hexagon 後端 GELU 精度
llama.cpp 發布 b11486 建置,Hexagon 後端的 GELU 啟用函式精度得到改進(#30104)。該版本繼續為驍龍平台提供 Hexagon NPU、Adreno GPU 與 CPU 三類後端,覆蓋 Linux arm64、Android arm64 與 Windows arm64。
llama.cpp b11433 為 Hexagon NPU 加入池化運算元支援
llama.cpp 新建置 b11433 在高通 Hexagon NPU 後端加入 pool 運算元支援,包含 pool_1d 與 pool_2d。同一批提交重寫了 DMA 流水線、加入池化分塊(pool chunking)、移除並向量化全部標量路徑,並最佳化 HTP 池化邊界、簡化分塊求解器與清理冗餘檢查。