熱點事件 · 持續更新
llama.cpp v0.6.0 發布:新增擴充套件 batch API 與多款模型支援上升
2 則報導2 個報導來源10/5 20:24 更新
先了解這件事AI 綜述
2026 年 10 月 5 日,llama.cpp 發布 v0.6.0,新增擴充套件 batch API、多款新模型支援與多項後端效能最佳化。據 release notes,本版引入 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入;新增 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型和 Clef 決策模型(文字與視覺);為 Qwen4Exp 加入 MTP 投機解碼,稱在 DGX Spark 上解碼約快 1.5 倍。伺服器新增 /v1/systemone API,支援 laya、julia-1、lev、openjev(含視覺)、kev 五個決策模型;Web UI 重構,接入 Hugging Face Hub 資料層與模型下載流程。Metal 後端新增 F16 KV 的 tensor API flash attention kernel,以及面向投機與批次解碼的 few-row MMA mat-mul kernel,稱在 Apple GPU 上 mat-mul 最高約快 3 倍;Vulkan 增加量化 K/V 的稀疏 flash attention;ggml 升級到 v0.26.0。
AI 根據 2 則報導生成 · 10/5 23:20 更新
報導時間線
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
10月5日星期一 · 1 則
-
llama.cpp releases官方● 精選
llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。
本事件熱度走勢
10/5 18:30最高 1.810/6 02:50
為什麼熱
過去 48 小時,有 2 個獨立來源報導,最近 6 小時新增 0 個。熱度 1.6,熱門榜第 6 名。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
事件紀錄
- 最早報導
- 10/5 17:58
- 最近更新
- 10/5 20:24
同一事件的報導集中在這裡,新的進展會繼續補充。