llama.cpp releases10/5 06:24AI 評分42
llama.cpp 在 CUDA 小批次下用 MMVF 最佳化 f16/bf16 矩陣乘法
llama.cpp 合併 PR #29633,在 CUDA 後端針對小批次場景的 thin f16/bf16 mul_mat 改用 MMVF 指令,並調整了核心選擇邏輯。該改動由 NVIDIA 工程師提交,影響 Ubuntu 與 Windows 的 CUDA 12/13 建置,面向在 NVIDIA GPU 上執行本地推理的使用者。