AISpot

搜尋

依意思最接近的 30 筆

llama.cpp releases● 精選10/5 17:58AI 評分82

llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援

llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。

llama.cpp releases10/3 00:57AI 評分25

llama.cpp 伺服器新增 /v1/systemone API,支援 laya、julia-1 等模型

llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。

X @ggerganov● 精選10/5 20:24AI 評分77

@ggerganov: The new v0.6.0 release packs a lot of good stuff:

llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。

llama.cpp releases10/4 20:50AI 評分23

llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置

llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;

X @ggerganov● 精選10/6 14:27AI 評分75

llama.cpp v0.6.0 支援 DFlash,Qwen3.8-27B 推理提速

llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。

llama.cpp releases10/4 18:49AI 評分35

llama.cpp 發布 b11396 版本,Windows LLVM 建置需 Ninja 多配置

llama.cpp 發布 b11396 版本,主要變更是 Windows 平台的 LLVM 建置需要 Ninja 多配置(#29959)。該版本提供覆蓋 macOS、Linux、Windows、Android 和 openEuler 的預編譯產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 被標記為…

llama.cpp releases10/2 14:11AI 評分43

llama.cpp 為 Hexagon NPU 增加 q2_k 與 q3_k 量化支援

llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。

llama.cpp releases10/4 10:37AI 評分27

llama.cpp 修復預設白名單中失效的 LLAMA_ARG_HF_REPO_FILE 鍵

llama.cpp 發布 b11385 版本,修復了預設允許列表中失效的 LLAMA_ARG_HF_REPO_FILE 鍵(#29938)。該版本繼續為 macOS、Linux、Windows、Android 等平台提供建置,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版與 openEuler 建置被標記為 DISABLED…

llama.cpp releases10/6 19:16AI 評分40

llama.cpp b11447 發布:新增 pplx-decider 模型支援

llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;

Cloudflare blog (AI)● 精選10/1 14:04AI 評分68

Cloudflare 將 EuroLLM 與 Apertus 兩個歐洲開源模型接入 Workers AI

Cloudflare 在生日周宣布,將歐洲兩個公共機構訓練的開源模型 EuroLLM 和 Apertus 引入 Workers AI,現已開放訪問申請。EuroLLM 覆蓋 35 種語言,含全部 24 種歐盟官方語言;Apertus 由瑞士 ETH Zurich、EPFL 等開發,訓練資料超 15 萬億 token、覆蓋 1500 多種語言,權重與資料全部公開。Cloudflare 同時啟動面向政府網路安全機構與關鍵基礎設施運營方的實操工作坊,首場 10 月在新加坡舉行。

llama.cpp releases10/3 15:27AI 評分48

llama.cpp 修復 Ling 3.0 解析器忽略 json_schema 的問題

llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器開始遵循 inputs.json_schema。此前 Ling 3.0 只為工具呼叫建置語法,response_format 請求不受約束;新實現加入優先於工具的回應格式語法路徑,並在啟用思考時要求先輸出 think 塊、JSON 回應後不允許追加散文。該修復對應 issue #29652,隨新版建置覆蓋 macOS、Linux、Windows、Android 等平台。

llama.cpp releases10/6 07:57AI 評分45

llama.cpp b11436 修復 OpenVINO 後端多項 GPU 迴歸

llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;

llama.cpp releases10/5 15:50AI 評分42

llama.cpp 發布 b11424,修復 Vulkan Flash Attention 共享記憶體越界寫

llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。

llama.cpp releases10/5 09:19AI 評分12

llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤

llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。

llama.cpp releases● 精選10/5 17:57AI 評分62

llama.cpp 版本號升至 0.6.0,多平台建置產物同步更新

llama.cpp 將版本號提升到 0.6.0(PR #29997),並更新了 scripts 的 summary prompt。隨版本給出的建置產物覆蓋 macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,含 CUDA 12、CUDA 13、ROCm 10.0、Vulkan、OpenVINO、SYCL)、Android arm64、Windows(x64/arm6…