AISpot

搜尋

依意思最接近的 1 筆

r/LocalLLaMA top of the day● 精選10/3 07:18AI 評分79

llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。