AISpot

搜尋

依意思最接近的 6 筆

Hacker News front page10/4 13:51AI 評分62

Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行

開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。

r/LocalLLaMA top of the day10/3 07:49AI 評分68

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

r/LocalLLaMA top of the day10/3 04:12AI 評分43

Strata 搭配 Qwen3.8 Next 在 DDR4 平台跑出 45-70t/s

有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。

r/LocalLLaMA top of the day10/3 07:18AI 評分70

llama.cpp 新 PR 將 Qwen4 索引器視訊記憶體減半

llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。

r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80

微軟發布 4B 程式設計智慧體模型 FrogNano

微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。