llama.cpp releases10/2 19:55AI 評分50
ggml 新增 alloc_buffer_n 緩衝區分配介面
ggml 為 backend buffer type 介面新增 alloc_buffer_n 與 get_alloc_size_n,Meta 緩衝型別提供多裝置子上下文實現,並補充測試。
找到 2 筆
ggml 為 backend buffer type 介面新增 alloc_buffer_n 與 get_alloc_size_n,Meta 緩衝型別提供多裝置子上下文實現,並補充測試。
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。