AISpot

搜尋

找到 3 筆;也可以試試 語意搜尋

MLX releases● 精選4/22 02:43AI 評分68

MLX 發布 v0.31.2,擴充套件 CUDA 量化矩陣乘支援

蘋果機器學習框架 MLX 發布 v0.31.2,重點擴充套件 CUDA 後端的量化矩陣乘支援,覆蓋 3/5/6 位量化與 qmm_naive、qmm_sm80 等路徑,並新增 CUDA FFT 支援。該版本還允許 MLX 被多執行緒用於獨立計算,JACCL 成為獨立庫,同時修復多執行緒退出崩潰、safetensors 偏移校驗等問題。

llama.cpp releases● 精選10/5 16:55AI 評分70

llama.cpp Hexagon flash_attn 改按 KV head 分核,PP 最高提升 58%

llama.cpp 的 Hexagon 後端(b11430)把 flash_attn 從按 Q token 切分改為按 KV head 分核:當 n_kv_heads 能被核心數整除時,每個核心只讀自己那份 KV cache,不再重複讀全量 KV。新行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制、預設開啟;無法整除時(如 4 核跑 2 個 KV head 的 Gemma-4)回退到原 token 分塊。