AISpot

搜尋

依意思最接近的 8 筆

r/LocalLLaMA top of the day10/3 15:16AI 評分11

r/LocalLLaMA 熱議 8GB 視訊記憶體跑本地模型的困境

Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。

NVIDIA blog● 精選10/2 14:00AI 評分80

NVIDIA DGX Spark 推出 64GB 版,10 月 23 日 4999 美元起

NVIDIA 宣布 DGX Spark 新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 發售,起售價 4999 美元。該機型保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 AI 軟體棧,支援最高 1000 億引數模型本地執行;兩臺可通過 ConnectX-7 直連組成 128GB 叢集,支援 2000 億引數模型,官方 Qwen 3.8 27B 測試效能提升至 1.7 倍。

r/LocalLLaMA top of the day10/3 04:12AI 評分43

Strata 搭配 Qwen3.8 Next 在 DDR4 平台跑出 45-70t/s

有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。

r/LocalLLaMA top of the day10/3 21:06AI 評分70

176B MoE 模型在 16GB 視訊記憶體筆記本上跑通

開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。

NVIDIA blog● 精選10/7 19:45AI 評分88

輝達與微軟發布 RTX Spark,為 Windows 打造 AI agent 平台

輝達與微軟在舊金山 Windows AI 活動上宣布,為 Windows PC 共同設計可常駐執行 AI agent 的軟硬體。RTX Spark 筆記本當日開啟預售、10 月 16 日發售,緊湊桌上型電腦 11 月上市,最高 128GB 統一記憶體與 1 petaFLOP FP4 算力,可在本地不限量執行 125B 的 Qwen 3.8 Flash Next 等模型。系統級容器 MXC 正式可用,讓 agent 在 Windows 中安全後臺常駐;

r/LocalLLaMA top of the day10/3 08:08AI 評分19

阿里買迷你主機搭 Qwen3.8 RAG,收到 2018 年舊 CPU

一名使用者為 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 購買迷你主機,商家標稱 Intel N150 與 DDR4/DDR5,實際發貨為 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz。賣家還把 New_N150 寫進 BIOS 版本字串偽裝型號。該主機效能不足以支撐向量檢索,使用者已發起信用卡拒付。