AISpot

LocalLLaMA 網友曬本地跑模型硬體方案

r/LocalLLaMA top of the day10/3 02:58社群討論地端推論

r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。

原標題:I'm pretty close to the middle thanks to you all
閱讀原文

評分35 / 30(平均 32,門檻 76)
狀態未入選

相關報導

r/LocalLLaMA top of the day10/3 07:49AI 評分51

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

r/LocalLLaMA top of the day10/3 04:12AI 評分61

Strata 搭配 Qwen3.8 Next 讓慢記憶體跑出 45-70t/s

有使用者用 Strata 加 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 加 7900XTX 的慢速記憶體機器上穩定跑到 45-70t/s,編碼時偶爾更高;同樣配置下調優後的 llama.cpp 最高只有約 22.5t/s。12GB 和 16GB 顯示卡使用者反饋結果相近,DDR5 使用者則明顯更快。作者建議讓 LLM 按自己的硬體配置來設定,並提醒不要用 Q2 權重。

r/LocalLLaMA top of the day10/3 19:58AI 評分49

開發者發布 Ninfer 4080,16GB 顯示卡可跑 100k 上下文

開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。

r/LocalLLaMA top of the day10/2 19:47AI 評分59

llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ

llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。