llama.cpp releases10/6 14:27AI 評分42
llama.cpp b11443 合併各模型的 nextn 行裁剪邏輯
llama.cpp 發布 b11443 建置,其中提交 #30017 把各模型重複的 nextn 行裁剪邏輯合併為 llm_graph_context 上的 crop_before_nextn() 與 crop_after_nextn() 兩個共享 helper。
找到 3 筆;也可以試試 語意搜尋
llama.cpp 發布 b11443 建置,其中提交 #30017 把各模型重複的 nextn 行裁剪邏輯合併為 llm_graph_context 上的 crop_before_nextn() 與 crop_after_nextn() 兩個共享 helper。
llama.cpp 發布 b11440,修復投機 MTP 解碼中 NextN 提取標誌變化導致的排程器預留失效報錯。啟用 MTP 後,NextN 提取在目標與草稿上下文的排程器已預留之後才開啟;未掩碼提取時主幹圖保留最後一層的全部 token 而非裁剪到輸出行,首次解碼按該批次形狀重分配,下一批更寬的批次就會觸發 GGML_SCHED_DEBUG_REALLOC。修復方式是在標誌變化時作廢預留,讓下一次計算按新圖形狀重新預留,並隨各平台預編譯包發布。
llama.cpp 合併 PR #14891,為 GGUF 格式 imatrix 引入基於啟用值的統計計算,新增 --activation-statistics 引數。該功能可計算啟用熵、餘弦相似度、L2 範數及歐氏-餘弦分數(ECS),並支援外部 NextN 草稿檔案(-md / --model-draft)。預設不啟用啟用統計以避免 imatrix 體積翻倍,統計報告佈局與排序也按 imatrix 型別更新。