搜尋
找到 35 筆
LM Studio blog● 精選9/18 01:00AI 評分75
Inco AI 推出開源推理引擎 Splash,專為 Apple Silicon 本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,併為每個模型配備 DFlash 2 草稿模型做投機解碼。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四路併發短提示合計吞吐 170 tokens/s,為次快引擎的 3.9 倍。
X @Alibaba_Qwen9/30 12:18AI 評分51
阿里 Qwen 宣布 Qwen3.8-27B 已可通過 Nebius 訪問。官方稱這是一個 27B 稠密模型,適用於建置 agent 或做深度研究等多步工作流場景。目前公布的資訊僅限接入渠道與模型規格,未提及價格、上下文長度或開放區域。
r/LocalLLaMA top of the day10/3 07:13AI 評分61
開發者 nubela 發布 gufo 分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s prefill、190 tok/s decode,目標為 3000 tok/s prefill 與 150 tok/s decode。該分支為 Qwen3.6 35B A3B 增加支援,面向優先速度而非智慧的負載;作者自行量化模型並以 Apache 2.0 發布,稱 unsloth 的 GGUF 也可用但效能較低。
r/LocalLLaMA top of the day● 精選10/2 22:47AI 評分80
有人在單張 RTX PRO 6000 上對三個 Qwen3.8 檢查點做了 10 項測試:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 Flash-Next NVFP4。27B 配 DFlash2 草稿模型後 Spec-Bench 從 75 提到 210 tok/s,約 2.8 倍;SGLang 整體快於 vLLM,但同一匯出上 vLLM 快 16%。
X @lmstudio● 精選9/19 01:45AI 評分63
LM Studio 宣布與 inco_ai 合作,在發布首日(day 0)接入其 Splash 推理引擎,用於在本地執行 Qwen3.8-27B。官方給出的實測資料是在 M5 Max 上最高可達 144 tok/s。使用者可通過 LM Studio 官方部落格的連結獲取並立即執行。
Qwen blog● 精選9/18 08:00AI 評分88
阿里推出新一代原生全模態模型 Qwen3.8-Omni-Flash,已在千問 AI 平台上線,支援文字、影像、音訊、影片輸入,上下文視窗達 100 萬 token。該模型在 29 項評測中平均分較 Qwen3.5-Omni-Plus 提升超 25%,音影片輸入價格分別下降超 98% 和 93%,並開源 Qwen-Live Harness 即時執行時。
X @ggerganov● 精選10/6 14:27AI 評分75
llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。
r/LocalLLaMA top of the day10/3 07:49AI 評分68
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
r/LocalLLaMA top of the day10/3 08:08AI 評分19
一名使用者為 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 購買迷你主機,商家標稱 Intel N150 與 DDR4/DDR5,實際發貨為 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz。賣家還把 New_N150 寫進 BIOS 版本字串偽裝型號。該主機效能不足以支撐向量檢索,使用者已發起信用卡拒付。
Simon Willison● 精選10/5 00:34AI 評分66
有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。
r/LocalLLaMA top of the day10/3 04:12AI 評分43
有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。
Ollama releases● 精選10/6 02:53AI 評分79
Ollama 發布 v0.40.0:在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。本次納入 MLX 的模型包括 qwen3.8、gemma4、qwen3.6、qwen3.5,決策模型 Nimble、tev1、clef、clef-flash 也已支援。可用 ollama pull / run qwen3.8 拉取與執行,官方稱將繼續啟用更多模型。
Qwen blog● 精選9/18 10:30AI 評分79
Qwen3.8-LiveTranslate 採用 Interleave 架構,將同傳平均延遲(LAAL)從上一代的 2.8 秒降至 2.3 秒,並新增即時說話人分離、雙語同屏同步輸出與長上下文消歧三項能力。模型基於 Hybrid-MoE 的 Thinker–Talker 雙模組設計,支援 60 種語言的音訊輸入與文字輸出、29 種語言的語音輸出,可通過 DashScope API 接入,會話配置即可啟用說話人分離與原文譯文同步返回,無需單獨呼叫 ASR 介面。
Hacker News front page10/4 13:51AI 評分62
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
Ollama releases● 精選10/6 19:47AI 評分82
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8,其他可用模型還包括 gemma4、qwen3.6 和 qwen3.5;決策模型 Nimble、tev1、clef、clef-flash 也已支援 MLX,並新增嵌入模型 embeddinggemma-2 支援。官方表示會繼續測試並啟用更多模型。
r/LocalLLaMA top of the day10/3 21:06AI 評分70
開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。
r/LocalLLaMA top of the day10/3 02:33AI 評分42
作者發布專為 RTX5090 打造的推理引擎 MegaCapybara,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單任務編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。引擎具備 VRAM-RAM-DISC 快取管理、雙層 Loop Guard、帶後設資料的自研權重格式(可對比 BF16 顯示 KL 與 top-1% 損失)以及圖形介面,採用 MIT 許可,原始碼與權重建置器後續發布。
Ollama releases● 精選10/5 00:54AI 評分75
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。可用模型包括 qwen3.8、gemma4、qwen3.6、qwen3.5,決策模型 Nimble、tev1、clef、clef-flash 也已登陸 MLX,官方稱會繼續測試並啟用更多模型。
Ollama releases● 精選10/4 17:37AI 評分80
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8;預發布期間會繼續測試並啟用更多模型。
llama.cpp releases● 精選10/3 12:54AI 評分70
ggml-openvino 後端更新到 2026.4.1,重點最佳化 Qwen3.5 MoE 推理效能,並新增推理效能分析、預設使用遠端輸出張量、磁碟快取模型直載(cache_only)等能力。在 Arc B390 上以 q4_asym64_all 重量化執行 gemma-4-26B-A4B,pp512 從 66.16 t/s 提升到 1608.73 t/s,tg128 從 25.94 提升到 26.46 t/s,困惑度基本不變。
Hacker News front page10/2 22:25AI 評分71
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。
Hugging Face blog● 精選10/2 16:19AI 評分70
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
r/LocalLLaMA top of the day10/3 01:00AI 評分72
宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,引數 6B,用約 2500 小時真實機器人資料訓練,單個模型可完成 64 項任務(10 項全身 + 54 項桌面),並支援平行夾爪與兩種靈巧手。架構上以基於 Qwen3-VL 的具身推理器 UnifoLM-ER-1 為起點,加入光流與 VQ-VAE 的未來動態區域預測、殘差 VQ 動作離散化,以及 MMDiT 動作專家做連續控制。演示在宇樹 G1 上完成鋪床、裝洗衣機、疊衣服、物體分揀等操作。
機器之心● 精選10/7 13:43AI 評分72
維吉尼亞理工、威斯康辛大學麥迪遜分校與達特茅斯學院團隊在 NeurIPS 2026 提出 SAGE,用結構訊號引導長程推理的後訓練。方法以符號閉包分析(SCA)解釋探索偏差與累積偏差,訓練時用代數稀疏化和雙曲結構引導重排候選推理步,在 12 個基準、7 個模型家族上總體優於 SFT、GRPO、EMPO 與 GRPO-PRM。在 1,190 個 Andrews–Curtis 長程例項上,Qwen3 的 Lean 驗證通過率接近基礎模型的 8 倍;
MLX LM releases2/12 18:40AI 評分55
MLX 發布 v0.30.7,新增 GLM5 與 Qwen3.5 系列(不含視覺)支援,並修復 Kimi Linear、DeepSeek V3.2 索引器與權重載入問題。該版本為 LFM2 模型加入 Pythonic 工具呼叫,新增 Mistral 工具解析器與 LongCat MLA,同時提升 DeepSeek V3.2 生成速度,訓練流程中驗證集改為可選。
MLX LM releases3/7 03:59AI 評分42
MLX 發布 v0.31.0,新增 Qwen 3.5 張量並行支援、JoyAI LLM Flash 模型,並加入 --prefill-step-size 命令列引數以權衡速度與視訊記憶體。該版本集中修復了 CacheList 儲存/載入、MLA 模型混合量化、MiniMax M2.5 分片 RMS Norm 等問題,同時改進服務端快取並新增 cached_tokens 用量欄位。
X @ggerganov● 精選10/5 20:24AI 評分77
llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。
Hacker News front page● 精選10/7 03:02AI 評分77
Strands Labs 開源了 2B 引數的決策模型 Strands Decider 2B,權重已上 Hugging Face,訓練資料與指令碼一併公開。它基於 Qwen3.5-2B 去掉 LM head、換成約百萬引數的 pointer head 並加 rank-16 LoRA 微調,只能從給定選項中作答或打分,因此不支援編碼、聊天與摘要。
r/LocalLLaMA top of the day10/3 16:42AI 評分52
作者搭建了魔獸世界私服 jankcraft.xyz,並開發瀏覽器客戶端,PC 和手機均可免費遊玩。隨後用自訂 MCP 與 agent harness 通過 websocket 控制客戶端,讓 LLM 自動玩遊戲,agent 頁面已上線。本地模型需服務端開啟 CORS,作者自託管的幾個模型可能因用量增長下線;24GB 記憶體可跑 Qwen3.8-27B-GPTQ-W4A16,16GB 記憶體可用 vLLM 跑 Gemma4-e4b-coder。
Hacker News front page10/7 13:04AI 評分75
一份 50 篇材料、約 1300 題的新基準(Telegraph Test,程式碼與資料已開源)顯示,只需一句小寫指令讓模型用 1866 年跨大西洋電纜時代的電報體(cablese)撰寫壓縮記錄,輸出 token 可省 40%–49%,而下游模型讀取這些記錄的準確率不低於明文(恢復比 0.99–1.10)。GLM-5.3-Flash 自身省 48.4%,qwen3.8-27b 省 48.9%,gemma-4-31b 省 40.4%;
Kimi blog● 精選10/2 22:11AI 評分88
月之暗面開源最新模型 Kimi K2.6,主打編碼、長程執行與 Agent 叢集能力,已上線 Kimi.ai、Kimi App、API 和 Kimi Code。官方稱其在內部基準 Kimi Code Bench 上較 K2.5 明顯提升,並給出兩個長程案例:在 Mac 上用 Zig 實現 Qwen3.5-0.8B 本地推理,經 4000+ 次工具呼叫、12 小時以上執行、14 輪迭代,吞吐從約 15 提升到約 193 tokens/秒,比 LM Studio 快約 20%;
量子位● 精選10/2 08:34AI 評分65
openJiuwen 團隊發布自演進模型路由技術 X-Router,在 PinchBench 全量 147 個任務實測中,靜態路由得分 66.3%、成本 $8.25,相比全量呼叫 Kimi-K2-Thinking 的 71.36%、$11.11,成本降低 44.6%。該技術基於五檔複雜度分檔路由,用本地 Qwen3-0.6B 做程序內分類器,支援端雲分級與 Bandit 自演進,並已接入 WorkSwarm 的 MoA 多模型協同。
r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80
微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。
Qwen blog● 精選9/3 01:00AI 評分80
阿里推出 Qwen-Drive-1.0,稱其為首個在預訓練階段統一 3D 感知與視覺問答、並擴充套件至運動規劃的自動駕駛視覺語言基礎模型,且不改動預訓練 VLM 架構。模型基於原生多模態的 Qwen3.5-4B,外掛 BEV 感知頭(3D 檢測、語義佔用預測、BEV 地圖分割)與用流匹配生成 5 秒軌跡的 Planning Expert。訓練僅用公開資料共 283 萬樣本,駕駛 QA 平均分 69.43,WOD-E2E 開環 ADE 5s 達 1.27/2.65。
機器之心● 精選10/5 12:40AI 評分72
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。