AISpot

搜尋

找到 6 筆

r/LocalLLaMA top of the day10/2 22:47AI 評分47

RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍

在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。

r/LocalLLaMA top of the day10/3 02:33AI 評分30

MegaCapybara 發布:RTX5090 上跑 Qwen3.8 27B 的推理引擎

MegaCapybara 是專為 RTX5090 打造的推理引擎,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單路編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。它自帶權重格式與後設資料,載入前會展示各量化設定相對 BF16 的 KL 與 top-1% 損失,並支援智慧 VRAM-RAM-DISC 快取、Loop Guard 與圖形介面。採用 MIT 許可,原始碼與權重建置器稍後發布。

r/LocalLLaMA top of the day10/3 08:08AI 評分12

阿里買迷你主機跑 Qwen3.8 RAG,BIOS 硬改型號騙過系統

一位使用者為給 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 買了一臺標稱 Intel N150 的迷你主機,收到的卻是 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz 記憶體。賣家把 New_N150 寫進 BIOS 版本字串(HSHW_M6_DDR3_EC_Intel_Com_New_N150_K001)來偽裝型號,導致系統識別為假規格,連索引文字檔案都吃力,更別說跑向量檢索。該使用者已發起信用卡拒付。

LM Studio blog● 精選9/18 01:00AI 評分82

Inco AI 開源 Splash 引擎,最佳化 Apple Silicon 本地推理

Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。