搜尋
找到 9 筆
llama.cpp releases10/2 19:55AI 評分50
llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 與 get_alloc_size_n 方法,並公開 ggml_backend_buft_alloc_buffer_n、ggml_backend_buft_get_alloc_size_n 兩個 API。預設實現負責多緩衝區分割與張量分配,Meta buffer type 提供自訂實現,按裝置建立子上下文並委託給 simple buffer type;
llama.cpp releases10/3 02:32AI 評分58
llama.cpp 合併 PR #27096,修復 ggml-cpu 中 GGML_OP_SOFT_MAX_BACK 在 dst 與 src1(y)別名時輸出靜默錯誤的問題。原因是原實現先覆蓋 y 再讀取,改為單次融合迴圈先讀兩個源再寫,並新增迴歸測試強制觸發該別名。CUDA 核心因先完成歸約再寫入,不受影響。
X @ggerganov● 精選9/22 14:00AI 評分83
ggml 作者 ggerganov 宣布,transformers 現在可以直接執行 GGUF 模型。這項工作把 ggml 的 Metal 核心引入 transformers 生態,提升了相容性與效能。更多細節見其後續說明。
r/LocalLLaMA top of the day● 精選10/3 07:18AI 評分79
llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。
r/LocalLLaMA top of the day10/2 19:47AI 評分59
llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。
llama.cpp releases● 精選10/3 13:40AI 評分77
llama.cpp 合併 PR #29856,把 build_rs 中分散的 get_rows 合併為一次收集全部 n_rs 個 recurrent states,使預留空間按 n_rs 最大值計算,避免 ubatch 單元不連續時在節點數不變的情況下觸發圖重分配、進而在 GGML_SCHED_NO_REALLOC 下中止。
X @ggerganov● 精選9/4 16:30AI 評分88
NVIDIA 已收購 Hugging Face,llama.cpp 作者 ggerganov 確認這一訊息。NVIDIA 工程師已為 llama.cpp 貢獻程式碼、協作社群並提供開發測試硬體超過一年。ggerganov 表示 llama.cpp/ggml 將繼續堅持硬體無關原則,所有後端的開發與支援仍由社群驅動,向所有人開放。
llama.cpp releases10/3 12:54AI 評分42
ggml-openvino 後端更新至 2026.4.1,新增 MoE 路由融合與 GDN 歸一化融合,並預設在 GPU 上啟用 MoE 融合。在 Arc B390 上跑 gemma-4-26B-A4B,配合 q4_asym64 重新量化,pp512 從 66.16 t/s 提升到 1608.73 t/s,困惑度基本不變。同時修復了 stateful 執行下 rank-3 軸處理導致的 MoE 崩潰,並改進裝置列舉與記憶體上報。
llama.cpp releases10/3 02:58AI 評分58
llama.cpp 合併 PR #29817,在 qkx3 量化級別送入 nearest_int 前先鉗制到 [0, nmax],避免 imatrix 縮放搜尋產生無窮、NaN 或越界值時觸發 Debug 建置斷言。該問題由 #29804 報告,修復同時為 q2_K、q4_K、q5_K、q4_1、q5_1 的退化 imatrix 分組補充迴歸測試。合法範圍內的取值行為不變,macOS Apple Silicon(arm64)等預編譯包已隨本次發布更新。