AISpot

搜尋

依意思最接近的 6 筆

llama.cpp releases10/5 09:37AI 評分59

llama.cpp Vulkan 後端加入量化 K/V 稀疏 Flash Attention

llama.cpp 合併 PR #29639,為 Vulkan 後端加入針對量化 K/V 快取的稀疏 Flash Attention,並把稀疏 FA 的索引壓縮改為單次掃描。原實現每行 mask 用一個 workgroup、按 BLOCK_SIZE 分塊各做一次掃描,解碼時單個 workgroup 要跑 KV/1024 次受 barrier 限制的迭代,128k 單元格下開銷超過它服務的稀疏注意力本身。

r/LocalLLaMA top of the day10/3 19:24AI 評分42

專用推理引擎興起,放棄通用性換極致效能

近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。

llama.cpp releases10/5 08:08AI 評分40

llama.cpp 為 4 頭 lightning indexer 新增 CUDA 分塊核心

llama.cpp 合併 b11405 版本更新,為 lightning indexer 在 CUDA 與 ROCm 後端新增分塊核心,針對 4 頭場景最佳化。新核心將鍵以半精度暫存、查詢逐頭載入,每執行緒負責一個鍵對兩個 token,避免點積的跨執行緒歸約;同時把乘積改為 float 計算以防 half2 溢位,並讓每個鍵元素只擴充套件一次供所有頭使用。ROCm 上內層迴圈展開 8 次,gfx908 僅用 63 個 VGPR 無溢位,R9700 上核心提速 36 倍。

Hacker News front page10/2 03:51AI 評分43

Greg Kroah-Hartman 在 Kernel Recipes 2026 談 LLM 時代的安全

Linux 核心穩定分支維護者 Greg Kroah-Hartman 在 Kernel Recipes 2026 發表題為《Security in the LLM age》的演講,影片時長 56 分 51 秒,於 2026 年 9 月 29 日發布在 Kernel Recipes 的 YouTube 頻道,目前播放量約 9,566 次、193 個贊、32 條評論。該頻道訂閱數 8.1K,影片採用 Creative Commons 署名許可,部分語言的音軌為自動生成。

llama.cpp releases10/4 13:34AI 評分36

llama.cpp 修復 Vulkan 後端 RDNA4 矩陣向量調優

llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。