搜尋
找到 3 筆;也可以試試 語意搜尋
llama.cpp releasesAI 評分41
llama.cpp 發布建置 b11526,主要修復 Vulkan 後端 rms_norm 工作組數量溢位(#30145)。該版本繼續為 macOS/iOS、Linux、Windows、Android 與 openEuler 提供多後端建置,覆蓋 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 以及驍龍平台的 Adreno GPU 與 Hexagon NPU;
llama.cpp releasesAI 評分42
llama.cpp 發布建置 b11527(PR #30219),WebGPU 後端移除 1D workgroup 派發,所有原本使用 1D 派發的運算元(如 rms_norm)統一改為 2D workgroup dispatch。
MLX LM releasesAI 評分42
MLX 發布 v0.31.0,新增 Qwen 3.5 張量並行支援、JoyAI LLM Flash 模型,並加入 --prefill-step-size 命令列引數以權衡速度與視訊記憶體。該版本集中修復了 CacheList 儲存/載入、MLA 模型混合量化、MiniMax M2.5 分片 RMS Norm 等問題,同時改進服務端快取並新增 cached_tokens 用量欄位。