AISpot

Qwen3.8 27B 在 DGX Spark 復現文字加法實驗,169 題答對 167

Simon Willison10/5 00:34評測研究地端推論

有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。

給出 Qwen3.8 27B 在本地 DGX Spark 上開啟推理後的文字加法實測數字(169 次中 167 次正確)並附推理鏈,對在本地跑模型、關注 LLM 算術能力的人有參考。

原標題:Qwen3.8 27B addition in words
閱讀原文

評分64 / 68(平均 66,門檻 65)
狀態精選

相關報導

r/LocalLLaMA top of the day10/3 07:49AI 評分68

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

r/OpenAI top of the day10/3 10:06AI 評分38

使用者反饋 GPT-6 Astra 長任務超限後不輸出內容

有使用者反映,用 GPT-6 Astra 處理 10 萬字元以上、生成 70 多頁文件時,模型會先執行 30 到 40 分鐘,隨後直接報 5 小時用量限制錯誤,不輸出任何內容。使用者只能新建對話、稍微縮小任務重試,並稱 ChatGPT 與 Gemini 估算這類大規模執行每次 API 等效算力成本約 3 到 5 美元。該使用者質疑 OpenAI 為何不在任務開始前提示拆分,導致算力被浪費。

r/LocalLLaMA top of the day10/3 15:16AI 評分11

r/LocalLLaMA 熱議 8GB 視訊記憶體跑本地模型的困境

Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。

Hacker News front page10/4 13:51AI 評分62

Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行

開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。