搜尋
依意思最接近的 9 筆
r/LocalLLaMA top of the day10/3 07:13AI 評分73
開發者 nubela 發布了 gufo 的分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s 預填充和 190 tok/s 解碼,目標是 3000 tok/s 預填充與 150 tok/s 解碼。該分支為追求速度而非智慧的負載設計,作者自行量化了模型並以 Apache 2.0 許可發布,使用 unsloth 的 GGUF 也可執行但效能較低。
r/LocalLLaMA top of the day10/3 04:12AI 評分61
有使用者用 Strata 加 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 加 7900XTX 的慢速記憶體機器上穩定跑到 45-70t/s,編碼時偶爾更高;同樣配置下調優後的 llama.cpp 最高只有約 22.5t/s。12GB 和 16GB 顯示卡使用者反饋結果相近,DDR5 使用者則明顯更快。作者建議讓 LLM 按自己的硬體配置來設定,並提醒不要用 Q2 權重。
r/LocalLLaMA top of the day10/2 22:47AI 評分47
在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。
r/LocalLLaMA top of the day10/3 07:49AI 評分51
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
r/LocalLLaMA top of the day10/3 02:58AI 評分32
r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。
r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80
微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。
r/LocalLLaMA top of the day10/3 15:16AI 評分21
一位只有 8GB 視訊記憶體和 16GB 記憶體的使用者在社群表示,只能期待 Qwen4 35B A3B 或類似模型,並希望藉助額外 n-gram 把 35B 擴充套件到 70B 以上。在此之前,他仍偏愛 Gemma 26B QAT,稱其速度穩定在 26 Tg/s。
llama.cpp releases● 精選10/2 14:11AI 評分60
llama.cpp b11345 為 Hexagon 後端新增 Q2_K 和 Q3_K 量化型別支援,對應 PR #29717,並統一了 src1_row_size 的分配;改動由 Max Krasnyansky(maxk@qti.qualcomm.com)參與提交。
r/LocalLLaMA top of the day10/3 02:33AI 評分30
MegaCapybara 是專為 RTX5090 打造的推理引擎,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單路編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。它自帶權重格式與後設資料,載入前會展示各量化設定相對 BF16 的 KL 與 top-1% 損失,並支援智慧 VRAM-RAM-DISC 快取、Loop Guard 與圖形介面。採用 MIT 許可,原始碼與權重建置器稍後發布。