8GB 視訊記憶體使用者期待 Qwen4 35B A3B 等本地模型
一位只有 8GB 視訊記憶體和 16GB 記憶體的使用者在社群表示,只能期待 Qwen4 35B A3B 或類似模型,並希望藉助額外 n-gram 把 35B 擴充套件到 70B 以上。在此之前,他仍偏愛 Gemma 26B QAT,稱其速度穩定在 26 Tg/s。
依意思最接近的 12 筆
一位只有 8GB 視訊記憶體和 16GB 記憶體的使用者在社群表示,只能期待 Qwen4 35B A3B 或類似模型,並希望藉助額外 n-gram 把 35B 擴充套件到 70B 以上。在此之前,他仍偏愛 Gemma 26B QAT,稱其速度穩定在 26 Tg/s。
llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。
開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。
Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。
NVIDIA 提出衡量 AI 工廠投資回報的三個變數:產能(每兆瓦吞吐與每 token 成本)、使用壽命和需求。它援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍;每兆瓦 AI 工廠造價約 6000 萬美元。
llama.cpp 發布 b11355 版:對共享記憶體為 32KB 的三星 GPU,Vulkan 後端停用大型 matmul tile(#28531),該提交由 Claude Op 協助完成。此版本中 macOS Apple Silicon 的 KleidiAI 啟用建置(arm64, KleidiAI enabled)與 openEuler 建置標記為 DISABLED;
有使用者用 Strata 加 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 加 7900XTX 的慢速記憶體機器上穩定跑到 45-70t/s,編碼時偶爾更高;同樣配置下調優後的 llama.cpp 最高只有約 22.5t/s。12GB 和 16GB 顯示卡使用者反饋結果相近,DDR5 使用者則明顯更快。作者建議讓 LLM 按自己的硬體配置來設定,並提醒不要用 Q2 權重。
llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。
NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;
llama.cpp 合併 PR #29570,在 Metal 後端新增基於 tensor API 的 flash attention 核心,支援 F16 KV 快取。同一批提交還補充了 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等形狀的 tensor FA 核心,並支援 attention sinks、ALiBi 與 logit softcap。
llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。
Percepta 發布新架構 Spotlight,用可寫記憶取代注意力,是首個在不增加訪問成本的前提下實現記憶無限增長的架構。每個 token 讀寫無界記憶,但模型學會索引單個記憶單元,因此每次只觸及少量單元;無論記憶如何增長,觸及單元數不變,稀疏度可任意調節。該架構把負責計算的情報模組與儲存知識、流程和工作狀態的記憶分離,記憶增長時情報模組大小與權重都不變。模型可自己決定逐 token 載入和覆蓋哪些記憶,記憶既能存事實也能存技能,因此不必重訓練就能獲得新能力。