熱點事件 · 持續更新
llama.cpp 合併 PR:Qwen 索引器視訊記憶體減半
2 則報導2 個報導來源10/3 12:28 更新
先了解這件事AI 綜述
2026 年 10 月 3 日,llama.cpp 合併了 PR #29825(作者 ServeurpersoCom),把 Qwen Flash Next 的 lightning indexer 打分視訊記憶體佔用減半,隨版本 b11372 發布。據 PR 說明,此前索引器一次性算出所有 head 的分數並保留一份副本,長上下文下同時存在兩個 [n_pool, n_idx_h, n_tokens] 的 f32 張量,是計算圖中最大的緩衝區;現在每個 head 單獨計算,整流後原地累加進一個 [n_pool, n_tokens] 分數。作者給出的數字是:131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB,並稱 logits 完全一致、僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。後端方面,CUDA 新增支援 4 heads(分派到 vector kernel,因為數量太少不足以填滿 wmma tile),Metal 把 head 數改為函式常量傳入並零填充最後一個 head tile,64 heads 表現不變,Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。r/LocalLLaMA 討論中有人懷疑 decode 變慢,但未給出資料。對本地跑開源模型的人來說,長上下文下的視訊記憶體壓力明顯下降。
AI 根據 2 則報導生成 · 10/3 13:01 更新
報導時間線
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
10月3日星期六 · 2 則
-
llama.cpp releases官方● 精選
llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。
-
r/LocalLLaMA top of the day● 精選
llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。
本事件熱度走勢
10/3 11:50最高 1.810/3 14:30
為什麼熱
過去 48 小時,有 2 個獨立來源報導,最近 6 小時新增 1 個。熱度 1.8,熱門榜第 4 名。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
事件紀錄
- 最早報導
- 10/3 07:18
- 最近更新
- 10/3 12:28
同一事件的報導集中在這裡,新的進展會繼續補充。