AISpot

搜尋

找到 2 筆;也可以試試 語意搜尋

X @ggerganov● 精選10/6 14:27AI 評分75

llama.cpp v0.6.0 支援 DFlash,Qwen3.8-27B 推理提速

llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。

LM Studio blog● 精選9/18 01:00AI 評分75

Inco AI 發布 Splash 引擎,Apple Silicon 本地跑 Qwen3.8

Inco AI 推出開源推理引擎 Splash,專為 Apple Silicon 本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,併為每個模型配備 DFlash 2 草稿模型做投機解碼。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四路併發短提示合計吞吐 170 tokens/s,為次快引擎的 3.9 倍。