AISpot

搜尋

依意思最接近的 7 筆

r/LocalLLaMA top of the day10/3 15:16AI 評分11

r/LocalLLaMA 熱議 8GB 視訊記憶體跑本地模型的困境

Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。

NVIDIA blog10/1 14:00AI 評分25

輝達稱 Vera Rubin NVL72 每兆瓦吞吐量超 GB300 30 倍

輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。

NVIDIA blog● 精選10/2 14:00AI 評分80

NVIDIA DGX Spark 推出 64GB 版,10 月 23 日 4999 美元起

NVIDIA 宣布 DGX Spark 新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 發售,起售價 4999 美元。該機型保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 AI 軟體棧,支援最高 1000 億引數模型本地執行;兩臺可通過 ConnectX-7 直連組成 128GB 叢集,支援 2000 億引數模型,官方 Qwen 3.8 27B 測試效能提升至 1.7 倍。

Hacker News front page10/3 18:23AI 評分68

Vx 發布:把 CPU、GPU、NPU 記憶體寫進型別系統的程式語言

Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯而非執行時崩潰。它要求跨記憶體空間的資料移動顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期據此接受或拒絕放置方案。

llama.cpp releases10/4 13:34AI 評分36

llama.cpp 修復 Vulkan 後端 RDNA4 矩陣向量調優

llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。