llama.cpp b11346:qwen4exp 修復測試
llama.cpp b11346 修復 qwen4exp 測試,並提供多平台構建。
找到 8 筆
llama.cpp b11346 修復 qwen4exp 測試,並提供多平台構建。
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
llama.cpp 發布 b11349,為 Vulkan 管線編譯問題新增日誌,並覆蓋 macOS、Linux、Windows、Android 等多平台構建。
llama.cpp 構建 b11345 為 Hexagon NPU 後端新增 q2_k 和 q3_k 量化型別支援(#29717),並統一了 src1_row_size 的分配。該版本產物覆蓋 macOS Apple Silicon、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 版本為 DISABLED。
llama.cpp 合併 PR #29828,為 Hexagon 安裝重建的 HTP skels 並修復目錄依賴。
ggml 為 backend buffer type 介面新增 alloc_buffer_n 與 get_alloc_size_n,Meta 緩衝型別提供多裝置子上下文實現,並補充測試。
Ollama v0.35.1 通過 /v1/systemone 接入 Cloudflare 開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可同時帶圖片和文字狀態。本次更新還把聯網搜尋上限從每次回答 3 次提升到 10 次,並更新了 llama.cpp 與 MLX 引擎。
v0.34.4 已發布。思考模型的結構化輸出改為單次通過,更快更可靠,並修復本地大模型庫間歇性報 model not found 及 macOS 應用檢查 ChatGPT、Codex 時卡死的問題。Qwen 3.8 在 Apple Silicon 上提示處理更快,Gemma 4 會按圖選最佳解析度以保留更多細節。