AISpot

搜尋

依意思最接近的 24 筆

r/LocalLLaMA top of the day10/3 07:49AI 評分51

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

r/LocalLLaMA top of the day10/2 22:47AI 評分47

RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍

在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。

r/LocalLLaMA top of the day10/3 04:12AI 評分61

Strata 搭配 Qwen3.8 Next 讓慢記憶體跑出 45-70t/s

有使用者用 Strata 加 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 加 7900XTX 的慢速記憶體機器上穩定跑到 45-70t/s,編碼時偶爾更高;同樣配置下調優後的 llama.cpp 最高只有約 22.5t/s。12GB 和 16GB 顯示卡使用者反饋結果相近,DDR5 使用者則明顯更快。作者建議讓 LLM 按自己的硬體配置來設定,並提醒不要用 Q2 權重。

r/LocalLLaMA top of the day10/3 08:08AI 評分12

阿里買迷你主機跑 Qwen3.8 RAG,BIOS 硬改型號騙過系統

一位使用者為給 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 買了一臺標稱 Intel N150 的迷你主機,收到的卻是 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz 記憶體。賣家把 New_N150 寫進 BIOS 版本字串(HSHW_M6_DDR3_EC_Intel_Com_New_N150_K001)來偽裝型號,導致系統識別為假規格,連索引文字檔案都吃力,更別說跑向量檢索。該使用者已發起信用卡拒付。

r/LocalLLaMA top of the day10/3 02:58AI 評分32

LocalLLaMA 網友曬本地跑模型硬體方案

r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。

r/LocalLLaMA top of the day10/3 02:33AI 評分30

MegaCapybara 發布:RTX5090 上跑 Qwen3.8 27B 的推理引擎

MegaCapybara 是專為 RTX5090 打造的推理引擎,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單路編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。它自帶權重格式與後設資料,載入前會展示各量化設定相對 BF16 的 KL 與 top-1% 損失,並支援智慧 VRAM-RAM-DISC 快取、Loop Guard 與圖形介面。採用 MIT 許可,原始碼與權重建置器稍後發布。

r/LocalLLaMA top of the day10/3 07:13AI 評分73

gufo 分支讓 Qwen3.6 35B A3B 在 Strix Halo 上跑出 3095tok/s 預填充

開發者 nubela 發布了 gufo 的分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s 預填充和 190 tok/s 解碼,目標是 3000 tok/s 預填充與 150 tok/s 解碼。該分支為追求速度而非智慧的負載設計,作者自行量化了模型並以 Apache 2.0 許可發布,使用 unsloth 的 GGUF 也可執行但效能較低。

r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80

微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

r/LocalLLaMA top of the day10/3 21:06AI 評分75

TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

r/LocalLLaMA top of the day10/3 12:44AI 評分75

Aleph Alpha 發布 78B MoE 開源模型 Kolibri-1

德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,78B 總引數、3.46B 啟用引數,支援最高 100 萬 token 上下文,Apache 2.0 許可。模型用 768 張 B300 訓練 4 周、20T token,語料約 62.5% 英文、23.9% 德文、13.6% 程式碼。目前尚無量化版本,llama.cpp 是否支援該架構未知,社群評測認為效能接近 Qwen 3.5 35B。

r/LocalLLaMA top of the day10/3 19:58AI 評分49

開發者發布 Ninfer 4080,16GB 顯示卡可跑 100k 上下文

開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。

r/LocalLLaMA top of the day● 精選10/3 07:18AI 評分79

llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。

量子位10/2 08:34AI 評分52

openJiuwen 首發 X-Router 自演進模型路由,實測省 50%+ Token

openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。

Hacker News front page10/2 22:25AI 評分62

Ai2 開源 AstaBrief 8B 科學報告模型與訓練資料

Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;

r/LocalLLaMA top of the day10/2 20:17AI 評分52

自託管 AI 並不省錢,博主稱仍會繼續本地部署

使用者 basnijholt 在 Reddit 發帖並附上部落格文章,論證自託管 AI 並不比用 API 更省錢,但他表示自己照樣會做。他提出兩點:把 200 美元的訂閱(如 Opus 5.5、Astra)與 Qwen 3.8 27B 這類本地模型直接比價並不對等;他也不會把 200 GB 的郵件、聊天記錄和位置歷史交給 API,哪怕對方承諾零資料保留。帖子發出後引發了不少爭議。

Hugging Face blog● 精選10/2 16:19AI 評分65

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。

Hacker News front page10/3 10:36AI 評分72

Aleph Alpha 發布 Kolibri:78B 總參 3B 啟用開源權重模型

德國 Aleph Alpha 於 2026 年 10 月 3 日發布 Kolibri,一個英德雙語 MoE Transformer,總引數 78B、啟用 3B,支援最長 1M token 上下文,權重已在 Hugging Face 以 Apache 2.0 許可開放下載。它面向公共管理、工業與航空航天等受監管領域,針對德語、推理、數學與 agentic 行為做了專門最佳化,官方稱其品質與服務成本處於帕累托前沿,數學、程式碼、長上下文等基準可對標啟用引數最多四倍於己的模型。

r/LocalLLaMA top of the day10/2 19:47AI 評分59

llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ

llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。

r/LocalLLaMA top of the day10/2 22:49AI 評分27

開發者開源二戰主題小模型 Peacebell,291M 與 148M 兩版

開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。

Google AI blog● 精選10/2 16:00AI 評分68

Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。

r/LocalLLaMA top of the day10/3 12:47AI 評分53

r/LocalLLaMA 熱議低位元量化對編碼任務的影響

r/LocalLLaMA 上一則帖子引發討論:FP8/BF16 使用者看到有人跑 IQ1_S 量化感到震驚。多位使用者指出,IQ1/IQ2 這類極端量化只適合創意寫作或閒聊,用於編碼、複雜邏輯推理或結構化 JSON 提取時困惑度飆升、語法和邏輯明顯崩壞;而 Q4_K_M 或 Q5_K_M 通常是多數模型的甜點區,困惑度曲線相對平坦、視訊記憶體佔用大幅下降且推理能力幾乎無損。

r/OpenAI top of the day10/3 10:06AI 評分56

ChatGPT 跑 30 分鐘才報用量超限,不提前提醒

有使用者用 GPT-6 Astra 處理 10 萬字元以上素材生成 70 多頁文件時,任務跑 30 到 40 分鐘、消耗大量算力後,直接報 5 小時用量上限錯誤,一個字都沒輸出。使用者只能新開對話、縮小任務重試,反覆多次。按 ChatGPT 與 Gemini 估算,這類大規模執行每次 API 等效算力成本約 3 到 5 美元。