llama.cpp releases● 精選10/5 16:55AI 評分70
llama.cpp Hexagon flash_attn 改按 KV head 分核,PP 最高提升 58%
llama.cpp 的 Hexagon 後端(b11430)把 flash_attn 從按 Q token 切分改為按 KV head 分核:當 n_kv_heads 能被核心數整除時,每個核心只讀自己那份 KV cache,不再重複讀全量 KV。新行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制、預設開啟;無法整除時(如 4 核跑 2 個 KV head 的 Gemma-4)回退到原 token 分塊。