AISpot
熱點事件 · 持續更新

llama.cpp v0.6.0 發布:新增擴充套件 batch API 與多款模型支援上升

2 則報導2 個報導來源10/5 20:24 更新

先了解這件事AI 綜述

2026 年 10 月 5 日,llama.cpp 發布 v0.6.0,新增擴充套件 batch API、多款新模型支援與多項後端效能最佳化。據 release notes,本版引入 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入;新增 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型和 Clef 決策模型(文字與視覺);為 Qwen4Exp 加入 MTP 投機解碼,稱在 DGX Spark 上解碼約快 1.5 倍。伺服器新增 /v1/systemone API,支援 laya、julia-1、lev、openjev(含視覺)、kev 五個決策模型;Web UI 重構,接入 Hugging Face Hub 資料層與模型下載流程。Metal 後端新增 F16 KV 的 tensor API flash attention kernel,以及面向投機與批次解碼的 few-row MMA mat-mul kernel,稱在 Apple GPU 上 mat-mul 最高約快 3 倍;Vulkan 增加量化 K/V 的稀疏 flash attention;ggml 升級到 v0.26.0。

AI 根據 2 則報導生成 · 10/5 23:20 更新

報導時間線

沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。

10月5日星期一 · 1 則

  1. llama.cpp releases官方● 精選

    llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援

    llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。

本事件熱度走勢

10/5 18:30最高 1.810/6 02:50

為什麼熱

過去 48 小時,有 2 個獨立來源報導,最近 6 小時新增 0 個。熱度 1.6,熱門榜第 6 名。

熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。

事件紀錄

最早報導
10/5 17:58
最近更新
10/5 20:24

同一事件的報導集中在這裡,新的進展會繼續補充。