Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
10 月 3 日至 4 日,開源專案 Strata 在本地推理社群引發關注:它讓 125B 引數的 Qwen3.8-Flash-Next 這類通常需要伺服器的模型,在消費級顯示卡上本地執行。據 r/LocalLLaMA 使用者 10 月 3 日報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高;同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,該使用者認為品質明顯更好,但不推薦 Q2 權重,並稱 12GB、16GB 顯示卡使用者有類似結果,DDR5 平台顯著更快。10 月 4 日 Hacker News 上的專案介紹稱,Strata 免費開源,支援 NVIDIA 或 AMD 12GB 以上顯示卡、Windows 與 Linux,模型可聊天、寫程式碼、讀圖並接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s,RX 9070 XT(16GB)為 60 與 1160 tokens/s,並預計 RTX 3090(24GB)可達 100-140 tokens/s。兩處報導對模型的稱呼略有不同,前者稱 Qwen3.8 Next,後者稱 Qwen3.8-Flash-Next(125B)。對視訊記憶體 12GB 以上、想在本地跑大模型的使用者,這意味著不必依賴伺服器即可執行千億引數級模型。
AI 根據 2 則報導生成 · 10/4 14:31 更新
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。
過去 48 小時,有 2 個獨立來源報導,最近 6 小時新增 1 個。熱度 1.3,熱門榜第 3 名。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
同一事件的報導集中在這裡,新的進展會繼續補充。