b11536: ui: Models Manager Follow-up Improvements (#30228)
llama.cpp 新版本 b11536 讓 server 的 GET /models 直接返回每個模型的訓練上下文長度(context_length),資料取自 GGUF 後設資料,無需載入模型或請求 Hugging Face Hub。新增的 common_get_gguf_n_ctx_train 只讀後設資料、相容 u32 與 u64,檔案缺失或無效時返回 0,router 列表因此可離線攜帶該欄位。
原標題:b11536: ui: Models Manager Follow-up Improvements (#30228)
閱讀原文
| 評分 | 45 / 45(平均 45,門檻 60) |
|---|---|
| 狀態 | 未入選 |
原文
相關報導
llama.cpp 發布 b11438,動態後端需顯式載入
llama.cpp 發布 b11438,主要變更是 test-llama-archs 在生成模型前先初始化後端(#30034):開啟 GGML_BACKEND_DL 時,必須先顯式載入後端才能建立模型。
llama.cpp b11436 修復 OpenVINO 後端多項 GPU 迴歸
llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;
llama.cpp 新增 clef 決策模型純文字支援
llama.cpp 合併 PR #29831,為 clef 決策模型加入初始支援,目前僅限純文字輸入。該改動同時更新了 gguf-py 常量並清理了靜態圖相關程式碼,隨附的建置產物覆蓋 macOS、Linux、Windows、Android 與 openEuler 等多個平台。
@ollama: .@GoogleDeepMind EmbeddingGemma 2 is now available on Ollama.
Google DeepMind 的 EmbeddingGemma 2 已上線 Ollama,執行 ollama pull embeddinggemma-2 即可拉取。訊息由 Ollama 官方帳號在 10 月 6 日發布,官方稱該模型面向消費級裝置,並且是多模態模型。原文未披露模型體積、上下文長度與具體支援的模態等細節。
@ggerganov: The new v0.6.0 release packs a lot of good stuff:
llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。