AISpot
所屬事件:Strata 讓 125B Qwen3.8 模型在消費級顯示卡本地執行(2 個來源 · 2 則報導)

10 月 3 日至 4 日,開源專案 Strata 在本地推理社群引發關注:它讓 125B 引數的 Qwen3.8-Flash-Next 這類通常需要伺服器的模型,在消費級顯示卡上本地執行。據 r/LocalLLaMA 使用者 10 月 3 日報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS… 看完整事件

Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行

Hacker News front page10/4 13:51官方公告地端推論開源模型

開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。

給出了 125B 級模型在 RTX 5070/3090 等消費級顯示卡上的具體實測速度與各量化檔位的記憶體適配建議,對想在本地跑大模型、用 coding agent 的開發者有直接參考價值。

原標題:Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
閱讀原文

同一事件共有 2 則報導(2 個來源),看事件全貌

評分42 / 82(平均 62,門檻 76)
狀態未入選

相關報導

r/LocalLLaMA top of the day10/3 07:49AI 評分68

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

r/LocalLLaMA top of the day10/3 21:06AI 評分70

176B MoE 模型在 16GB 視訊記憶體筆記本上跑通

開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。