Strata 讓 125B Qwen3.8 模型在消費級顯示卡本地執行上升
先了解這件事AI 綜述
10 月 3 日至 4 日,開源專案 Strata 在本地推理社群引發關注:它讓 125B 引數的 Qwen3.8-Flash-Next 這類通常需要伺服器的模型,在消費級顯示卡上本地執行。據 r/LocalLLaMA 使用者 10 月 3 日報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高;同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,該使用者認為品質明顯更好,但不推薦 Q2 權重,並稱 12GB、16GB 顯示卡使用者有類似結果,DDR5 平台顯著更快。10 月 4 日 Hacker News 上的專案介紹稱,Strata 免費開源,支援 NVIDIA 或 AMD 12GB 以上顯示卡、Windows 與 Linux,模型可聊天、寫程式碼、讀圖並接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s,RX 9070 XT(16GB)為 60 與 1160 tokens/s,並預計 RTX 3090(24GB)可達 100-140 tokens/s。兩處報導對模型的稱呼略有不同,前者稱 Qwen3.8 Next,後者稱 Qwen3.8-Flash-Next(125B)。對視訊記憶體 12GB 以上、想在本地跑大模型的使用者,這意味著不必依賴伺服器即可執行千億引數級模型。
AI 根據 2 則報導生成 · 10/4 14:31 更新
報導時間線
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
沒有符合條件的報導。
本事件熱度走勢
為什麼熱
過去 48 小時,有 2 個獨立來源報導,最近 6 小時新增 1 個。熱度 1.3,熱門榜第 3 名。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
事件紀錄
- 最早報導
- 10/3 04:12
- 最近更新
- 10/4 13:51
同一事件的報導集中在這裡,新的進展會繼續補充。