2026 年 10 月 6 日,llama.cpp 發布 b11450 版本,其 RPC 後端新增 -sm tensor 選項(#26610),支援在 RPC 場景下按 tensor 拆分模型。同一版本還修復了 Apple RDMA 的 flush 問題,把 graph_uids 移入 rpc_dispatcher,停… 看完整事件
llama.cpp 借 ggml RPC 後端實現異構裝置分散式推理
llama.cpp 現在可以通過 ggml RPC 後端,把推理任務分散到異構裝置上共同完成,即同一次推理可由不同型別的硬體一起承擔。llama.cpp 作者 Georgi Gerganov 說明,這一能力目前仍是進階設定,但會隨時間逐步降低使用門檻,讓普通使用者也能用上。原文未給出支援的具體硬體組合、效能表現或可用版本。
由 llama.cpp 作者親自確認 ggml RPC 後端可把推理分散到異構裝置,並提到後續會降低使用門檻,對關注本地推理與多裝置部署的開發者有參考價值。
原標題:@ggerganov: llama.cpp can distribute inference on heterogeneous devices through the ggml RPC backend
閱讀原文
| 評分 | 55 / 70(平均 62,門檻 65) |
|---|---|
| 狀態 | 未入選 |
相關報導
llama.cpp 發布 b11384 版本,覆蓋多平台預編譯包
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。
llama.cpp 建置 b11448:ggml-cuda 分塊處理大塊 BF16/FP16 轉 F32
llama.cpp 發布建置 b11448,ggml-cuda 後端把大塊 BF16/FP16 到 F32 的轉換改為分塊執行(#29442),並修正分塊 cuBLAS 矩陣乘法未遵循目標 stride 的問題,提交由 Johannes Gäßler 參與。改動僅涉及 CUDA 後端,影響用 NVIDIA GPU 做本地推理的場景;該建置同時覆蓋 macOS Apple Silicon 與 Linux、Windows 的 CUDA 12/13 等平台。
llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤
llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。
llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援
llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。
llama.cpp 發布 b11459:ggml-webgpu 在 WASI 上停用 Dawn 原生特性
llama.cpp 發布建置 b11459,唯一列出的程式碼改動是 ggml-webgpu 在 WASI 上不再啟用 Dawn 原生特性。該建置的預編譯產物覆蓋 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework、Linux、Android、Windows 以及 openEuler。後端包括 CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO 與 SYCL;