2026 年 10 月 5 日,llama.cpp 發布 v0.6.0,引入新的 llama_batch_ext 擴充套件 batch API(配合 llama_process()),支援混合 token/embedding 輸入與 MTP、deepstack 的逐 token 狀態嵌入;新增 320B 的 GLM-5… 看完整事件
llama.cpp v0.6.0 支援 DFlash,Qwen3.8-27B 推理提速
llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。
由 llama.cpp 作者直接給出 DFlash 的啟用命令與版本門檻,為在本地跑 Qwen3.8-27B 的使用者提供了可直接照做的提速配置。
原標題:@ggerganov: If you are using Qwen3.8-27B + MTP, make sure to upgrade to DFlash for extra speed:
閱讀原文
| 評分 | 72 / 78(平均 75,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
llama.cpp 發布 b11402,CUDA 後端改用整塊 FlashAttention 排程
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
llama.cpp 新 PR 將共享專家融合進 MMVQ,部分 MoE 架構提速
llama.cpp 的 PR #29184 提出在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構帶來提速,例如 Qwen 35B A3B。有評論稱該改動使 TG 速度提升約 5%,並指出僅對部分 MoE 架構有效。
llama.cpp 新 PR 將 Qwen4 索引器視訊記憶體減半
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
llama.cpp 發布 b11384 版本,覆蓋多平台預編譯包
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。