10 月 3 日至 4 日,開源專案 Strata 在本地推理社群引發關注:它讓 125B 引數的 Qwen3.8-Flash-Next 這類通常需要伺服器的模型,在消費級顯示卡上本地執行。據 r/LocalLLaMA 使用者 10 月 3 日報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS… 看完整事件
Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
給出了 125B 級模型在 RTX 5070/3090 等消費級顯示卡上的具體實測速度與各量化檔位的記憶體適配建議,對想在本地跑大模型、用 coding agent 的開發者有直接參考價值。
原標題:Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
閱讀原文
| 評分 | 42 / 82(平均 62,門檻 76) |
|---|---|
| 狀態 | 未入選 |
相關報導
Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
LocalLLaMA 網友曬本地跑模型硬體方案
Reddit 的 r/LocalLLaMA 版塊一則帖子下,使用者討論用低成本硬體本地跑大模型。有人稱 2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器最省錢,可讓 Qwen 3.8 Flash 跑到 15 tok/s 以上;也有人表示雙 7900XTX 不到 2000 美元即可支援 27B Q8 模型超過 220k 上下文。
實測 Qwen3.8 三版本:DFlash2 加速 2.8 倍
有人在單張 RTX PRO 6000 上對三個 Qwen3.8 檢查點做了 10 項測試:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 Flash-Next NVFP4。27B 配 DFlash2 草稿模型後 Spec-Bench 從 75 提到 210 tok/s,約 2.8 倍;SGLang 整體快於 vLLM,但同一匯出上 vLLM 快 16%。
兩臺 128GB Strix Halo 迷你主機各跑一個 300B 級 MoE 模型
Kyojin 引擎基於 ExLlamaV3 為 AMD Strix Halo(gfx1151、ROCm)打造,讓 GLM-5.3-Flash 與 MiMo-V2.6-Flash 兩個 300B 級 MoE 模型分別裝進單臺 128GB 迷你主機。實測在 Ryzen AI Max+ 395 上,GLM 預填充 580 tok/s、解碼 26-30 tok/s,MiMo 解碼最高 44 tok/s(程式碼場景)。
176B MoE 模型在 16GB 視訊記憶體筆記本上跑通
開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。