AISpot
熱點事件 · 持續更新

llama.cpp 合併 PR:Qwen 索引器視訊記憶體減半

2 則報導2 個報導來源10/3 12:28 更新

先了解這件事AI 綜述

2026 年 10 月 3 日,llama.cpp 合併了 PR #29825(作者 ServeurpersoCom),把 Qwen Flash Next 的 lightning indexer 打分視訊記憶體佔用減半,隨版本 b11372 發布。據 PR 說明,此前索引器一次性算出所有 head 的分數並保留一份副本,長上下文下同時存在兩個 [n_pool, n_idx_h, n_tokens] 的 f32 張量,是計算圖中最大的緩衝區;現在每個 head 單獨計算,整流後原地累加進一個 [n_pool, n_tokens] 分數。作者給出的數字是:131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB,並稱 logits 完全一致、僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。後端方面,CUDA 新增支援 4 heads(分派到 vector kernel,因為數量太少不足以填滿 wmma tile),Metal 把 head 數改為函式常量傳入並零填充最後一個 head tile,64 heads 表現不變,Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。r/LocalLLaMA 討論中有人懷疑 decode 變慢,但未給出資料。對本地跑開源模型的人來說,長上下文下的視訊記憶體壓力明顯下降。

AI 根據 2 則報導生成 · 10/3 13:01 更新

報導時間線

沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。

10月3日星期六 · 2 則

  1. llama.cpp releases官方● 精選

    llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

    llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。

  2. r/LocalLLaMA top of the day● 精選

    llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

    llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。

本事件熱度走勢

10/3 11:50最高 1.810/3 14:30

為什麼熱

過去 48 小時,有 2 個獨立來源報導,最近 6 小時新增 1 個。熱度 1.8,熱門榜第 4 名。

熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。

事件紀錄

最早報導
10/3 07:18
最近更新
10/3 12:28

同一事件的報導集中在這裡,新的進展會繼續補充。