Qwen3.8 27B 在 DGX Spark 復現文字加法實驗,169 題答對 167
有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。
給出 Qwen3.8 27B 在本地 DGX Spark 上開啟推理後的文字加法實測數字(169 次中 167 次正確)並附推理鏈,對在本地跑模型、關注 LLM 算術能力的人有參考。
原標題:Qwen3.8 27B addition in words
閱讀原文
| 評分 | 64 / 68(平均 66,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
使用者反饋 GPT-6 Astra 長任務超限後不輸出內容
有使用者反映,用 GPT-6 Astra 處理 10 萬字元以上、生成 70 多頁文件時,模型會先執行 30 到 40 分鐘,隨後直接報 5 小時用量限制錯誤,不輸出任何內容。使用者只能新建對話、稍微縮小任務重試,並稱 ChatGPT 與 Gemini 估算這類大規模執行每次 API 等效算力成本約 3 到 5 美元。該使用者質疑 OpenAI 為何不在任務開始前提示拆分,導致算力被浪費。
實測 Qwen3.8 三版本:DFlash2 加速 2.8 倍
有人在單張 RTX PRO 6000 上對三個 Qwen3.8 檢查點做了 10 項測試:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 Flash-Next NVFP4。27B 配 DFlash2 草稿模型後 Spec-Bench 從 75 提到 210 tok/s,約 2.8 倍;SGLang 整體快於 vLLM,但同一匯出上 vLLM 快 16%。
r/LocalLLaMA 熱議 8GB 視訊記憶體跑本地模型的困境
Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。
Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。