搜尋
依意思最接近的 30 筆
r/LocalLLaMA top of the day10/3 07:49AI 評分68
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
Simon Willison● 精選10/5 00:34AI 評分66
有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。
r/LocalLLaMA top of the day● 精選10/2 22:47AI 評分80
有人在單張 RTX PRO 6000 上對三個 Qwen3.8 檢查點做了 10 項測試:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 Flash-Next NVFP4。27B 配 DFlash2 草稿模型後 Spec-Bench 從 75 提到 210 tok/s,約 2.8 倍;SGLang 整體快於 vLLM,但同一匯出上 vLLM 快 16%。
Hacker News front page10/4 13:51AI 評分62
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
r/LocalLLaMA top of the day10/3 15:16AI 評分11
Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。
r/LocalLLaMA top of the day10/3 04:12AI 評分43
有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。
r/LocalLLaMA top of the day10/3 08:08AI 評分19
一名使用者為 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 購買迷你主機,商家標稱 Intel N150 與 DDR4/DDR5,實際發貨為 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz。賣家還把 New_N150 寫進 BIOS 版本字串偽裝型號。該主機效能不足以支撐向量檢索,使用者已發起信用卡拒付。
r/LocalLLaMA top of the day10/3 02:58AI 評分27
Reddit 的 r/LocalLLaMA 版塊一則帖子下,使用者討論用低成本硬體本地跑大模型。有人稱 2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器最省錢,可讓 Qwen 3.8 Flash 跑到 15 tok/s 以上;也有人表示雙 7900XTX 不到 2000 美元即可支援 27B Q8 模型超過 220k 上下文。
X @ggerganov● 精選10/6 14:27AI 評分75
llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。
機器之心● 精選10/5 12:40AI 評分72
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。
r/LocalLLaMA top of the day10/3 02:33AI 評分42
作者發布專為 RTX5090 打造的推理引擎 MegaCapybara,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單任務編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。引擎具備 VRAM-RAM-DISC 快取管理、雙層 Loop Guard、帶後設資料的自研權重格式(可對比 BF16 顯示 KL 與 top-1% 損失)以及圖形介面,採用 MIT 許可,原始碼與權重建置器後續發布。
llama.cpp releases10/2 14:11AI 評分43
llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。
r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80
微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。
r/LocalLLaMA top of the day10/3 07:18AI 評分70
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
r/LocalLLaMA top of the day10/3 07:13AI 評分61
開發者 nubela 發布 gufo 分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s prefill、190 tok/s decode,目標為 3000 tok/s prefill 與 150 tok/s decode。該分支為 Qwen3.6 35B A3B 增加支援,面向優先速度而非智慧的負載;作者自行量化模型並以 Apache 2.0 發布,稱 unsloth 的 GGUF 也可用但效能較低。
r/LocalLLaMA top of the day10/3 21:06AI 評分70
開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。
機器之心● 精選10/6 13:27AI 評分84
清華團隊開源後訓練模型 VeriLoop E2,由獨立外部 Verifier 決定候選狀態能否獲得提交資格,而非依賴模型內部置信度。該模型以 Qwen 3.8-27B 為基礎,面向程式碼、數學與物理三類可外部驗證任務,並同步發布標準權重與覆蓋 BF16 至 IQ1_M 的 GGUF 量化版,其中 Q6_K 為 20.566 GiB,比 BF16 小 58.96%。
r/LocalLLaMA top of the day10/3 19:58AI 評分75
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。
X @GoogleDeepMind● 精選10/6 17:04AI 評分80
Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。
量子位● 精選10/2 08:34AI 評分65
openJiuwen 團隊發布自演進模型路由技術 X-Router,在 PinchBench 全量 147 個任務實測中,靜態路由得分 66.3%、成本 $8.25,相比全量呼叫 Kimi-K2-Thinking 的 71.36%、$11.11,成本降低 44.6%。該技術基於五檔複雜度分檔路由,用本地 Qwen3-0.6B 做程序內分類器,支援端雲分級與 Bandit 自演進,並已接入 WorkSwarm 的 MoA 多模型協同。
Hugging Face blog● 精選10/2 16:19AI 評分70
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
r/LocalLLaMA top of the day● 精選10/3 12:44AI 評分80
德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,總引數 78B、啟用 3.46B,支援最高 100 萬 token 上下文,採用 Apache 2.0 許可。模型基於 20T token 的英德雙語語料訓練(約 62.5% 英語、23.9% 德語、13.6% 程式碼),在 768 張 B300 叢集上訓練約 4 周。社群討論認為其基準表現接近 Qwen 3.5 35B,適合 96GB 視訊記憶體本地部署,但目前尚無量化版本。
Hacker News front page10/2 22:25AI 評分71
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。
r/LocalLLaMA top of the day10/2 20:17AI 評分39
一篇部落格文章指出,自託管 AI 在成本上並不比使用 API 便宜,但作者依然選擇自建。作者強調不會把 200 GB 的郵件、訊息和位置歷史傳送給 API,即使對方承諾零資料保留。他還提醒,拿 200 美元訂閱與 Opus 5.5 或 Astra 對比 Qwen 3.8 27B 並非對等比較。
X @ggerganov● 精選10/5 20:24AI 評分77
llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。
Hacker News front page● 精選10/3 10:36AI 評分79
德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,總引數 78B、啟用引數 3B,支援最長 1M token 上下文,權重已在 Hugging Face 開放下載,採用 Apache 2.0 許可。該模型為英德雙語 MoE Transformer,面向公共管理、工業與航空航天等受監管領域,在 AIME 2025 上得分 96.9,官方稱其效能可對標啟用引數四倍於己的模型。
r/LocalLLaMA top of the day10/2 22:49AI 評分43
開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。
Hacker News front page● 精選10/6 17:03AI 評分85
Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。
機器之心● 精選10/6 13:36AI 評分77
普林斯頓大學陳丹琦團隊發布約 4B 引數的國際象棋模型 QUEEN,Lichess 等級分 2697,接近特級大師快棋中位數 2730,且能用自然語言解釋自己的著法。做法是把 Lc0 的 BT5 網路經門控交叉注意力逐層接入 SmolLM3-3B,先用四階段問答課程教模型讀棋,再用七輪迭代搜尋蒸餾提升。它在 1000 道戰術題上首步不失誤率 91.6%,領先 Gemini-3.1-Pro 約 9 個百分點;
r/LocalLLaMA top of the day10/2 19:47AI 評分65
llama.cpp 的 PR #29184 提出在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構帶來提速,例如 Qwen 35B A3B。有評論稱該改動使 TG 速度提升約 5%,並指出僅對部分 MoE 架構有效。