AISpot

搜尋

依意思最接近的 30 筆

llama.cpp releases● 精選AI 評分82

llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援

llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。

llama.cpp releasesAI 評分25

llama.cpp 伺服器新增 /v1/systemone API,支援 laya、julia-1 等模型

llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。

llama.cpp releasesAI 評分20

llama.cpp 修復 server 因 n_batch 超限導致的 abort

llama.cpp 合併 PR #29903,通過將 n_batch 限制為不超過 n_ubatch 來修復 server 崩潰問題,對應 issue #29902。該修復由 Claude 輔助完成,並移除了相關測試與 embeddings 條件。新版本已覆蓋 macOS、Linux、Windows、Android 等平台,包括 Apple Silicon、CUDA、ROCm、Vulkan 等後端。

X @ggerganov● 精選AI 評分77

@ggerganov: The new v0.6.0 release packs a lot of good stuff:

llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。

r/LocalLLaMA top of the dayAI 評分70

llama.cpp 新 PR 將 Qwen4 索引器視訊記憶體減半

llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。

X @ggerganov● 精選AI 評分75

llama.cpp v0.6.0 支援 DFlash,Qwen3.8-27B 推理提速

llama.cpp 作者 Georgi Gerganov 建議使用 Qwen3.8-27B + MTP 的使用者升級到 DFlash,以獲得額外速度提升。啟用方式是在最新 llama.cpp v0.6.0 上執行 llama serve -hf ggml-org/Qwen3.8-27B-GGUF,並加上 --spec-type draft-dflash 與 --spec-draft-n-max 7 兩個引數。該提示未給出具體提速幅度,只強調必須使用最新版本。

X @ggerganovAI 評分45

llama.cpp 登上 Windows 活動舞臺,作者期待本地 AI 普及

llama.cpp 作者 Georgi Gerganov(@ggerganov)稱,llama.cpp 出現在了 10 月 7 日 Windows 活動的主舞臺上。他表示軟體與硬體棧終於走到一起,社群過去多年的努力得到體現,並期待更多使用者擁抱本地 AI。推文未說明該活動的具體內容,也未提及 llama.cpp 在其中的展示形式。

llama.cpp releasesAI 評分36

llama.cpp 修復 Vulkan 後端 RDNA4 矩陣向量調優

llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。

llama.cpp releasesAI 評分35

llama.cpp 發布 b11396 版本,Windows LLVM 建置需 Ninja 多配置

llama.cpp 發布 b11396 版本,主要變更是 Windows 平台的 LLVM 建置需要 Ninja 多配置(#29959)。該版本提供覆蓋 macOS、Linux、Windows、Android 和 openEuler 的預編譯產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 被標記為…

llama.cpp releasesAI 評分37

llama.cpp 發布 b11465,覆蓋 CUDA 13 與 ROCm 10.0 等平台

llama.cpp 發布建置版本 b11465,本次改動是「測試:在測試遞迴回滾時保留 anchor」(#29923)。該版本提供的預編譯產物覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,其中 Windows 與 Linux 的 x64/arm64 均包含 CUDA 12、CUDA 13(CUDA 13.4 庫)、Vulkan、ROCm 10.0、OpenVINO、SYCL 等後端。

llama.cpp releasesAI 評分46

llama.cpp 新增 LiquidAI d1-omni-600M 決策模型

llama.cpp 建置 b11488 新增 LiquidAI/d1-omni-600M 決策模型支援,服務端可通過 images 與 input_audio 直接接收音訊輸入,模型與多模態輸入打通。同時決策型別 d1omni 更名為 lfm2-d1-omni,images 成為 files 的別名,無記憶的 lfm2 被限定為非因果模式,CUDA 後端保留 conformer 的 GLU sigmoid。四筆改動均標註由 Claude Opus 5.5 協助完成;

llama.cpp releasesAI 評分37

llama.cpp b11471 為詞表加入 Plamo FIM tokens

llama.cpp 發布 b11471 建置,主要變更是向詞表加入 Plamo 的 FIM(fill-in-the-middle)tokens,服務程式碼補全場景。該版本發布包覆蓋 macOS/iOS、Linux、Android、Windows 與 openEuler,後端包含 CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU。

llama.cpp releasesAI 評分42

llama.cpp b11521 服務端預設埠改為 9931

llama.cpp 新版本 b11521 把內建 server 的預設埠改為 9931,依賴預設埠的啟動指令碼與容器埠對映需相應調整。該版本同時放出各平台預編譯包,覆蓋 macOS Apple Silicon、iOS XCFramework、Ubuntu(CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL)、Windows x64/arm64、Android,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon…

llama.cpp releasesAI 評分42

llama.cpp 發布 b11461,修復 AMD 核顯 Vulkan 檢查點讀取慢

llama.cpp 發布 b11461,主要改動是修復 AMD 整合顯示卡在 Vulkan 後端下檢查點(checkpoint)讀取過慢的問題,對應 PR #30049。該版本同時更新了 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 後端。

llama.cpp releasesAI 評分23

llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置

llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;

llama.cpp releasesAI 評分37

llama.cpp b11539 應用上游深層巢狀 JSON 補丁

llama.cpp 發布 b11539 建置,唯一程式碼改動是應用來自上游的深層巢狀 JSON 補丁(#30253)。各平台預編譯包照常提供,覆蓋 macOS/iOS、Ubuntu(CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL)、Android、Windows 以及 openEuler。其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置本次被標記為 DISABLED。

llama.cpp releasesAI 評分12

llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤

llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。

llama.cpp releases● 精選AI 評分69

llama.cpp b11507 支援 MoE 快取跨多 GPU

llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。