搜尋
依意思最接近的 6 筆
llama.cpp releases10/3 12:28AI 評分42
llama.cpp 合併多項改動,將 indexer 分數視訊記憶體佔用減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現改為逐頭計算並原地累加為單個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 頭、Metal 以函式常量讀取頭數、Vulkan 按 64 鍵×8 token 分塊並改用 fp16 點積,indexer 改為呼叫 ggml_lightning_indexer 且鍵只讀一次。
llama.cpp releases10/5 08:08AI 評分40
llama.cpp 合併 b11405 版本更新,為 lightning indexer 在 CUDA 與 ROCm 後端新增分塊核心,針對 4 頭場景最佳化。新核心將鍵以半精度暫存、查詢逐頭載入,每執行緒負責一個鍵對兩個 token,避免點積的跨執行緒歸約;同時把乘積改為 float 計算以防 half2 溢位,並讓每個鍵元素只擴充套件一次供所有頭使用。ROCm 上內層迴圈展開 8 次,gfx908 僅用 63 個 VGPR 無溢位,R9700 上核心提速 36 倍。
llama.cpp releases10/5 14:09AI 評分33
llama.cpp 合併 PR #29990,在 MUSA 後端改用向量版 lightning indexer kernel。原因是 MUSA 架構 21 與 22 的靜態共享記憶體上限為 28 KB,而 tile kernel 需要 33 KB,所以 tile kernel 不用於 MUSA;CUDA 與 ROCm 仍執行合併後的原 kernel,沒有變化。
r/LocalLLaMA top of the day10/3 07:18AI 評分70
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
r/LocalLLaMA top of the day10/3 08:00AI 評分65
LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。
Cloudflare blog (AI)10/2 14:28AI 評分64
Cloudflare 宣布與 Ceramic.ai、Exa、Linkup 合作,通過 AI Gateway 提供 Web Search API,讓 agent 用搜尋查詢替代猜測 URL 抓取網頁。該 API 支援 AI Gateway 積分計費、日誌觀測、BYOK,並按合作方原價提供、不加價,同時提供 REST 介面與 Workers 繫結。合作方爬蟲須符合 Cloudflare 的 Verified bots 標準,遵守 robots.txt 並標註內容來源。