AISpot
所屬事件:llama.cpp v0.6.0 發布:新增 GLM-5.3-Flash 支援與 Metal 提速(2 個來源 · 3 則報導)

2026 年 10 月 5 日,llama.cpp 發布 v0.6.0,引入新的 llama_batch_ext 擴充套件 batch API(配合 llama_process()),支援混合 token/embedding 輸入與 MTP、deepstack 的逐 token 狀態嵌入;新增 320B 的 GLM-5… 看完整事件

llama.cpp v0.6.0 支援 DFlash,Qwen3.8-27B 推理提速

X @ggerganov10/6 14:27官方公告地端推論開源開發工具

llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。

由 llama.cpp 作者直接給出 DFlash 的啟用命令與版本門檻,為在本地跑 Qwen3.8-27B 的使用者提供了可直接照做的提速配置。

原標題:@ggerganov: If you are using Qwen3.8-27B + MTP, make sure to upgrade to DFlash for extra speed:
閱讀原文

同一事件共有 3 則報導(2 個來源),看事件全貌

評分72 / 78(平均 75,門檻 65)
狀態精選

相關報導

r/LocalLLaMA top of the day10/3 07:18AI 評分70

llama.cpp 新 PR 將 Qwen4 索引器視訊記憶體減半

llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。

r/LocalLLaMA top of the day10/3 07:49AI 評分68

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。