llama.cpp releases● 精選10/8 12:34AI 評分74
llama.cpp CUDA 重做 top-k 選擇:大行數改用 radix
llama.cpp 的 CUDA 後端重做 top-k 演算法選擇,大行數場景改用按行網格的 radix select 替代 CUB 逐行 DeviceTopKKernel,在 qwen4exp 34,816 tokens 上啟動次數從 1,671,253 次降到 2,329 次,耗時從 5,761.8 ms 降到 941.8 ms。
找到 3 筆;也可以試試 語意搜尋
llama.cpp 的 CUDA 後端重做 top-k 演算法選擇,大行數場景改用按行網格的 radix select 替代 CUB 逐行 DeviceTopKKernel,在 qwen4exp 34,816 tokens 上啟動次數從 1,671,253 次降到 2,329 次,耗時從 5,761.8 ms 降到 941.8 ms。
llama.cpp 發布 b11505,修復 Vulkan 後端 TOP_K 運算元在 +inf/NaN 輸入和 k=1 負值時的錯誤。原 bucket search 從 [0, 0xFF800000) 起算,+inf 與 NaN 永不被計數,可致 NVIDIA 上掛起或裝置丟失、AMD 上索引錯誤,並漏掉真實 top 值。
llama.cpp 發布建置 b11472,對符合條件、溫度為零的取樣鏈改用貪心選擇,CPU 與 grammar/reasoning-budget 路徑共用同一套貪心判定;動態溫度和顯式請求機率的場景仍保留分佈取樣,最終 top-k 且 k=1 之後也走貪心。改動由 Georgi Gerganov 參與,OpenAI Codex 協助,並在現有 sampler 測試中覆蓋常見取樣器選擇與機率行為。