llama.cpp releases● 精選10/3 01:28AI 評分80
llama.cpp 為 Metal 加入 F16 KV 的 tensor API flash attention 核心
llama.cpp 合併 PR #29570,在 Metal 後端新增基於 tensor API 的 flash attention 核心,支援 F16 KV 快取。同一批提交還補充了 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等形狀的 tensor FA 核心,並支援 attention sinks、ALiBi 與 logit softcap。