2026 年 10 月 5 日,llama.cpp 發布 v0.6.0,新增擴充套件 batch API、多款新模型支援與多項後端效能最佳化。據 release notes,本版引入 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstac… 看完整事件
@ggerganov: The new v0.6.0 release packs a lot of good stuff:
llama.cpp 發布 v0.6.0,作者 ggerganov 列出了這一版的主要更新:新增 Clef 支援,涵蓋文字與視覺;對 Qwen3.8-Flash-Next 提供高品質支援;Metal 後端效能大幅提升;並引入新的 llama_batch_ext API。配套官網也完成改版,地址為 llama.app。原文未給出各項改動的具體效能數字。
ggerganov 親自發布的版本說明,一次性給出 Clef 視覺支援、Qwen3.8-Flash-Next 適配、Metal 提速與新 API 四項變動,對本地跑 llama.cpp 的開發者最直接。
原標題:@ggerganov: The new v0.6.0 release packs a lot of good stuff:
閱讀原文
| 評分 | 75 / 80(平均 77,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
llama.cpp 版本號升至 0.6.0,多平台建置產物同步更新
llama.cpp 將版本號提升到 0.6.0(PR #29997),並更新了 scripts 的 summary prompt。隨版本給出的建置產物覆蓋 macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,含 CUDA 12、CUDA 13、ROCm 10.0、Vulkan、OpenVINO、SYCL)、Android arm64、Windows(x64/arm6…
llama.cpp 發布 b11384 版本,覆蓋多平台預編譯包
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。
llama.cpp b11418:server 支援 Clef 視覺輸入
llama.cpp 發布建置 b11418,其 server 新增對 Clef 的視覺輸入支援(PR #29969),並修復影像 token 上限、abort 與 yield_to_queue 資料變更等問題。
llama.cpp 發布 b11397,CUDA 後端調整 neu_padded 位置
llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp 發布 b11424,修復 Vulkan Flash Attention 共享記憶體越界寫
llama.cpp 發布 b11424 建置版本,修復 Vulkan 後端 Flash Attention 的共享記憶體越界寫問題(#29988)。該版本照例提供 macOS/iOS、Linux、Windows、Android 的預編譯包,涵蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL 等後端,並附驍龍 CPU/Adreno GPU/Hexagon NPU 的安裝指引。