搜尋
依意思最接近的 30 筆
r/LocalLLaMA top of the day10/3 02:49AI 評分68
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
X @ggerganov● 精選10/6 09:27AI 評分75
llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。
Hacker News front page10/4 08:51AI 評分62
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
X @Alibaba_Qwen10/8 23:36AI 評分43
阿里 Qwen 宣布,Qwen3.8-Max、Qwen3.8-Flash 與 Wan3.0 在 GMI Cloud 上限時免費開放一週,活動已經上線。開發者可在此期間免費呼叫這三款模型進行建置與測試,官方在推文中邀請開發者探索可行的用法。
r/LocalLLaMA top of the day● 精選10/2 17:47AI 評分80
有人在單張 RTX PRO 6000 上對三個 Qwen3.8 檢查點做了 10 項測試:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 Flash-Next NVFP4。27B 配 DFlash2 草稿模型後 Spec-Bench 從 75 提到 210 tok/s,約 2.8 倍;SGLang 整體快於 vLLM,但同一匯出上 vLLM 快 16%。
r/LocalLLaMA top of the day10/2 23:12AI 評分43
有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。
Simon Willison● 精選10/4 19:34AI 評分66
有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。
r/LocalLLaMA top of the day10/3 02:18AI 評分70
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
r/LocalLLaMA top of the day10/2 21:58AI 評分27
Reddit 的 r/LocalLLaMA 版塊一則帖子下,使用者討論用低成本硬體本地跑大模型。有人稱 2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器最省錢,可讓 Qwen 3.8 Flash 跑到 15 tok/s 以上;也有人表示雙 7900XTX 不到 2000 美元即可支援 27B Q8 模型超過 220k 上下文。
r/LocalLLaMA top of the day10/3 10:16AI 評分11
Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。
X @ggerganov● 精選10/5 15:24AI 評分77
llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。
機器之心● 精選10/8 22:40AI 評分78
VideoGen-Agent 用 Qwen3-VL-8B-Instruct 做基座,在多輪互動中呼叫檢索、生成與驗證工具,先以 16K 教師軌跡監督微調,再用 8K 提示做多工強化學習。在 600 條提示的 VABench 上,Toolset 1 配置得 75.6 分,比基礎生成器 56.5 分高出 19.1 分;智慧體策略不變、僅升級生成工具後達 86.1 分,人類評估中 84.3% 的判斷偏好該配置。
llama.cpp releases10/2 09:11AI 評分43
llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。
r/LocalLLaMA top of the day● 精選10/2 16:16AI 評分80
微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。
X @Alibaba_Qwen10/9 09:24AI 評分6
阿里 Qwen 官方 X 帳號在 2026 年 10 月 9 日發布動態,正文只有「Pics:」一詞,隨附圖片,沒有任何文字說明。公開可見的文字裡沒有出現模型名稱、版本號、功能或發布時間,因此無法確認圖片指向哪款產品或更新。要了解具體內容只能檢視原帖圖片,後續說明有待官方補充。
r/LocalLLaMA top of the day10/3 16:06AI 評分70
開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。
r/LocalLLaMA top of the day10/3 03:08AI 評分19
一名使用者為 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 購買迷你主機,商家標稱 Intel N150 與 DDR4/DDR5,實際發貨為 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz。賣家還把 New_N150 寫進 BIOS 版本字串偽裝型號。該主機效能不足以支撐向量檢索,使用者已發起信用卡拒付。
r/LocalLLaMA top of the day10/3 14:58AI 評分75
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。
llama.cpp releases10/9 05:29AI 評分50
llama.cpp 發布 b11518,Metal 後端加入 128 與 96 兩檔 Flash Attention 核心,並接受所有已編譯的維度組合(#30209)。該版本同時提供 macOS/iOS、Linux、Android、Windows 與 openEuler 的預編譯產物,覆蓋 CPU、Vulkan、CUDA 12/13、ROCm 10.0、SYCL、OpenVINO 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU;
r/LocalLLaMA top of the day10/3 02:13AI 評分61
開發者 nubela 發布 gufo 分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s prefill、190 tok/s decode,目標為 3000 tok/s prefill 與 150 tok/s decode。該分支為 Qwen3.6 35B A3B 增加支援,面向優先速度而非智慧的負載;作者自行量化模型並以 Apache 2.0 發布,稱 unsloth 的 GGUF 也可用但效能較低。
llama.cpp releases10/5 00:35AI 評分37
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
llama.cpp releases● 精選10/5 11:55AI 評分68
llama.cpp 的 Hexagon 後端在 row-split 多核模式下把 flash_attn 從按 Q token 切分改為按 KV head 切分,讓每個核心只讀自己負責的那部分 KV cache,不再重複讀取全部 KV cache。該行為由 GGML_HEXAGON_FA_HEAD_SPLIT 控制,預設開啟;當 n_kv_heads 不能被核心數整除時回退到原 token-block 切分(如 4 核上只有 2 個 KV head 的 Gemma-4)。
機器之心● 精選10/7 08:35AI 評分73
哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。
X @Alibaba_Qwen● 精選10/9 09:24AI 評分79
阿里發布 Qwen-Image-2.1-Turbo,這是基於 Qwen-Image-2.1 的加速 checkpoint,只需 8 步去噪即可生成和編輯影像,權重已在 ModelScope 與 Hugging Face 開放。它沿用同一 7B 視覺生成架構,官方稱步數減少不犧牲品質,仍可從文字生成 2K 影像,並支援用自然語言繼續編輯,例如新增配飾或更換場景。Diffusers 中載入 QwenImage21Pipeline 即可使用推薦的 8 步取樣;
r/LocalLLaMA top of the day10/2 21:33AI 評分42
作者發布專為 RTX5090 打造的推理引擎 MegaCapybara,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單任務編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。引擎具備 VRAM-RAM-DISC 快取管理、雙層 Loop Guard、帶後設資料的自研權重格式(可對比 BF16 顯示 KL 與 top-1% 損失)以及圖形介面,採用 MIT 許可,原始碼與權重建置器後續發布。
Hugging Face blog● 精選10/7 20:00AI 評分78
Hugging Face 的 yuvraj sharma 用 HuggingChat 裡的 ML Intern agent,幾天內做出 6 個公開模型,其中把 Qwen-Image 2.1 自帶的 9B 提示改寫器蒸餾成 0.8B 版本,可在 CPU 執行,輸出有效率 99.7%,token 消耗約為教師模型的四分之一。該專案含 9B 模型標註 8,797 條樣本,算力成本 16 美元。
Cloudflare blog (AI)10/2 09:28AI 評分64
Cloudflare 宣布與 Ceramic.ai、Exa、Linkup 合作,通過 AI Gateway 提供 Web Search API,讓 agent 用搜尋查詢替代猜測 URL 抓取網頁。該 API 支援 AI Gateway 積分計費、日誌觀測、BYOK,並按合作方原價提供、不加價,同時提供 REST 介面與 Workers 繫結。合作方爬蟲須符合 Cloudflare 的 Verified bots 標準,遵守 robots.txt 並標註內容來源。
Hugging Face blog● 精選10/2 11:19AI 評分70
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
Hacker News front page10/3 05:13AI 評分58
Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。
Google Developers blog10/8 18:10AI 評分60
Google Cloud 開源參考實現 AQuA(Ambient Quality Agent),用於持續診斷已在生產環境執行的 AI agent 的品質問題。它與生產 agent 並排執行,掃描失敗聚類並對照對話記錄逐條驗證,再把根因定位到當時實際部署的原始碼快照。它針對的場景是:agent 做到 80% 之後難以繼續改進,且靜默的品質回退仍然返回 HTTP 200 OK。