阿里買迷你主機跑 Qwen3.8 RAG,BIOS 硬改型號騙過系統
一位使用者為給 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 買了一臺標稱 Intel N150 的迷你主機,收到的卻是 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz 記憶體。賣家把 New_N150 寫進 BIOS 版本字串(HSHW_M6_DDR3_EC_Intel_Com_New_N150_K001)來偽裝型號,導致系統識別為假規格,連索引文字檔案都吃力,更別說跑向量檢索。該使用者已發起信用卡拒付。
原標題:I tried building a small RAG search node for Qwen3.8 27B using a fake AliExpress Mini PC... and Intel sent me back to 2018.
閱讀原文
| 評分 | 12 / 12(平均 12,門檻 76) |
|---|---|
| 狀態 | 未入選 |
相關報導
LocalLLaMA 網友曬本地跑模型硬體方案
r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。
8GB 視訊記憶體使用者期待 Qwen4 35B A3B 等本地模型
一位只有 8GB 視訊記憶體和 16GB 記憶體的使用者在社群表示,只能期待 Qwen4 35B A3B 或類似模型,並希望藉助額外 n-gram 把 35B 擴充套件到 70B 以上。在此之前,他仍偏愛 Gemma 26B QAT,稱其速度穩定在 26 Tg/s。
Strata 搭配 Qwen3.8 Next 讓慢記憶體跑出 45-70t/s
有使用者用 Strata 加 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 加 7900XTX 的慢速記憶體機器上穩定跑到 45-70t/s,編碼時偶爾更高;同樣配置下調優後的 llama.cpp 最高只有約 22.5t/s。12GB 和 16GB 顯示卡使用者反饋結果相近,DDR5 使用者則明顯更快。作者建議讓 LLM 按自己的硬體配置來設定,並提醒不要用 Q2 權重。
Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍
在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。