搜尋
找到 4 筆;也可以試試 語意搜尋
llama.cpp releases10/8 00:38AI 評分45
llama.cpp 發布 b11489,為 Hexagon NPU 的 Q6_K 權重反量化帶來加速,做法是再增加 2 倍迴圈展開,改動由 OpenCode 協助完成。該版本繼續提供 macOS/iOS、Linux、Android、Windows 多平台預編譯包,Snapdragon 版本可分別使用 CPU、Adreno GPU 與 Hexagon NPU,Windows arm64 另有 OpenCL Adreno 建置;
llama.cpp releases10/7 23:56AI 評分41
llama.cpp 的 Hexagon 後端新增 tiled Q4_K 與 Q6_K 的 GET_ROWS 支援,使驍龍 Hexagon NPU 能對這兩種量化格式執行嵌入查表,同一提交還修正了 Q4_K 檢視的校驗邏輯。改動由 OpenCode 協助完成,已隨本次建置發布,覆蓋 Android arm64 與 Linux arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合包。
llama.cpp releases10/5 03:41AI 評分42
llama.cpp 合併 PR #29483,為 WebGPU 的 MMVQ 路徑新增 Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K 和 MXFP4 量化支援,併為 Q1_0 引入 K_QUANTS_HANDLING 宏。該改動擴充套件了 WebGPU 後端可加速的量化模型範圍,相關建置覆蓋 macOS、Linux、Windows、Android 及 openEuler 等多個平台。
機器之心● 精選10/6 08:27AI 評分84
清華團隊開源後訓練模型 VeriLoop E2,由獨立外部 Verifier 決定候選狀態能否獲得提交資格,而非依賴模型內部置信度。該模型以 Qwen 3.8-27B 為基礎,面向程式碼、數學與物理三類可外部驗證任務,並同步發布標準權重與覆蓋 BF16 至 IQ1_M 的 GGUF 量化版,其中 Q6_K 為 20.566 GiB,比 BF16 小 58.96%。