Ninfer 4080 讓 16GB 顯示卡跑 100k 上下文
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。
找到 7 筆
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。
清華團隊開源後訓練模型 VeriLoop E2,由獨立外部 Verifier 決定候選狀態能否獲得提交資格,而非依賴模型內部置信度。該模型以 Qwen 3.8-27B 為基礎,面向程式碼、數學與物理三類可外部驗證任務,並同步發布標準權重與覆蓋 BF16 至 IQ1_M 的 GGUF 量化版,其中 Q6_K 為 20.566 GiB,比 BF16 小 58.96%。
r/LocalLLaMA 使用者集中討論名為 Strata 的推理方案,稱其是專為 Qwen 3.8 Flash Next 打造的 llama.cpp 分支,面向 12GB 以上視訊記憶體的 GPU。使用者實測在 16GB 視訊記憶體、24GB 視訊記憶體及 64GB 記憶體等配置上可執行該開源模型,有人報告解碼約 82 tok/s、60 tok/s 或 1200pp,並稱速度約為 Qwen 3.8 27B 在 llama.cpp 上的兩倍。也有人質疑相關帖子是機器人營銷,討論其是否為炒作。
一篇部落格文章指出,自託管 AI 在成本上並不比使用 API 便宜,但作者依然選擇自建。作者強調不會把 200 GB 的郵件、訊息和位置歷史傳送給 API,即使對方承諾零資料保留。他還提醒,拿 200 美元訂閱與 Opus 5.5 或 Astra 對比 Qwen 3.8 27B 並非對等比較。
NVIDIA 宣布 DGX Spark 新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 發售,起售價 4999 美元。該機型保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 AI 軟體棧,支援最高 1000 億引數模型本地執行;兩臺可通過 ConnectX-7 直連組成 128GB 叢集,支援 2000 億引數模型,官方 Qwen 3.8 27B 測試效能提升至 1.7 倍。
r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。
r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。