搜尋
找到 3 筆;也可以試試 語意搜尋
llama.cpp releases10/5 06:24AI 評分42
llama.cpp 合併 PR #29633,在 CUDA 後端針對小批次場景的 thin f16/bf16 mul_mat 改用 MMVF 指令,並調整了核心選擇邏輯。該改動由 NVIDIA 工程師提交,影響 Ubuntu 與 Windows 的 CUDA 12/13 建置,面向在 NVIDIA GPU 上執行本地推理的使用者。
MLX releases● 精選4/22 02:43AI 評分68
蘋果機器學習框架 MLX 發布 v0.31.2,重點擴充套件 CUDA 後端的量化矩陣乘支援,覆蓋 3/5/6 位量化與 qmm_naive、qmm_sm80 等路徑,並新增 CUDA FFT 支援。該版本還允許 MLX 被多執行緒用於獨立計算,JACCL 成為獨立庫,同時修復多執行緒退出崩潰、safetensors 偏移校驗等問題。
llama.cpp releases● 精選10/5 16:55AI 評分70
llama.cpp 的 Hexagon 後端(b11430)把 flash_attn 從按 Q token 切分改為按 KV head 分核:當 n_kv_heads 能被核心數整除時,每個核心只讀自己那份 KV cache,不再重複讀全量 KV。新行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制、預設開啟;無法整除時(如 4 核跑 2 個 KV head 的 Gemma-4)回退到原 token 分塊。