搜尋
找到 3 筆;也可以試試 語意搜尋
llama.cpp releases10/6 19:34AI 評分45
llama.cpp 發布建置 b11448,ggml-cuda 後端把大塊 BF16/FP16 到 F32 的轉換改為分塊執行(#29442),並修正分塊 cuBLAS 矩陣乘法未遵循目標 stride 的問題,提交由 Johannes Gäßler 參與。改動僅涉及 CUDA 後端,影響用 NVIDIA GPU 做本地推理的場景;該建置同時覆蓋 macOS Apple Silicon 與 Linux、Windows 的 CUDA 12/13 等平台。
llama.cpp releases10/4 21:07AI 評分45
llama.cpp 的 ggml-cpu 後端在 x86 上為 tinyBLAS 增加了 BF16、FP16、FP32 的 K 尾部支援並做了向量化,同時讓 CPU 測試在啟用 use_ref 時跳過 tinyBLAS,以便與 vec_dot 路徑對比。改動以 PR #29806 合入,隨 b11398 建置發布,覆蓋 macOS、Linux、Windows、Android 等多平台 CPU 與 GPU 後端。
llama.cpp releases10/3 12:28AI 評分42
llama.cpp 合併多項改動,將 indexer 分數視訊記憶體佔用減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現改為逐頭計算並原地累加為單個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 頭、Metal 以函式常量讀取頭數、Vulkan 按 64 鍵×8 token 分塊並改用 fp16 點積,indexer 改為呼叫 ggml_lightning_indexer 且鍵只讀一次。