熱點事件 · 持續更新
llama.cpp Metal 新增少行 MMA 核心,加速投機解碼
2 則報導1 個報導來源10/7 15:59 更新
先了解這件事AI 綜述
2026 年 10 月 5 日至 7 日,llama.cpp 連續合併兩個 PR,為 Metal 後端加入少行 MMA(矩陣乘)核心,用於加速投機解碼中的小批次矩陣乘法。起因是:在沒有 tensor API 的 Metal 裝置上,投機解碼每步要驗證少量 draft token,此前只能用 mat-vec 核心處理,耗時隨 src1 行數增加,導致 M3 Ultra 上 DFlash2 解碼反而慢於序列解碼。10 月 5 日的 PR #29869 先支援 2 到 16 行 src1:Q4_0、Q8_0、Q5_K 有專屬核心,F32、F16、Q4_1、Q5_0、Q5_1、Q4_K、Q6_K 走基於 16-weight 反量化器的通用路徑,Q4_0 在 2 行時使用 mat-vec 核心的 2 行變體;這些核心僅在 MTLGPUFamilyApple7 及以上、且無 tensor API 的裝置啟用,並設定各型別在 M3 Ultra 上開始優於舊核心的行數閾值(F32 為 6 行,F16、Q4_K、Q5_0、Q5_1 為 3 行,其他型別為 2 行)。同批改動還加入融合:MUL_MAT + ADD 在 MMA 儲存時疊加同形狀殘差,最多 16 個相鄰同佈局 f32 複製合併為一次 dispatch,相關檢查改為依據裝置屬性決定是否重排。
AI 根據 2 則報導生成 · 10/7 16:20 更新
報導時間線
沿著報導,了解事件的不同側面;點標題看單篇報導的摘要與原文連結。
10月7日星期三 · 1 則
-
llama.cpp releases官方● 精選
llama.cpp 的 Metal 後端將通用 few-row MMA 矩陣乘法核心擴充套件到更多權重量化型別,BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0 及 IQ 系列現已納入。該核心適用於任何帶 16-weight 反量化器的型別,各型別從在 M3 Ultra 上能勝過現有核心的行數起啟用:TQ2_0 為 5 行,BF16 為 4 行,MXFP4、Q2_0、Q2_K、IQ4_NL 為 3 行,其餘為 2 行。
10月5日星期一 · 1 則
-
llama.cpp releases官方● 精選
llama.cpp 合併 PR #29869,為 Metal 後端新增支援 2 到 16 行 src1 的 mat-mul 核心,用於加速投機解碼中的少行矩陣乘。此前 Metal 在無 tensor API 時用 mat-vec 核心處理這些運算,耗時隨 src1 行數增長,導致 M3 Ultra 上 DFlash2 解碼慢於序列解碼。
本事件熱度走勢
10/5 07:00最高 1.010/7 06:20
為什麼熱
過去 48 小時,有 0 個獨立來源報導,最近 6 小時新增 0 個。熱度 0.0。
熱度以 48 小時內的獨立來源計,同一來源只算一次,每 24 小時權重減半。
事件紀錄
- 最早報導
- 10/5 06:29
- 最近更新
- 10/7 15:59
同一事件的報導集中在這裡,新的進展會繼續補充。