AISpot

搜尋

找到 22 筆

llama.cpp releases10/7 12:11AI 評分42

llama.cpp 修復 SYCL 混用不同型號 GPU 的 FA 問題

llama.cpp 合併 PR #29071,修復 SYCL 後端在 Flash Attention(FA)中混用不同型號 GPU 時出現的問題。改動位於 ggml/src/ggml-sycl/ggml-sycl.cpp,提交由 Georgi Gerganov 共同署名。該修復包含在版本 b11464 中,此版本同時提供 Ubuntu x64(SYCL FP32、FP16)與 Windows x64(SYCL)等建置。

Hacker News front page10/3 21:19AI 評分43

Jeffy 發布 13 個本地預訓練分類器,無需 GPU

Jeffy 是一個可在普通電腦本地執行的分類器集合,無需 GPU,內建 13 個已訓練好的分類器,覆蓋垃圾資訊檢測、意圖路由、主題分類和情感分析,甚至能玩 Doom。使用者還可以用它訓練自己的分類器。專案作者在 Hacker News 上徵集使用場景與同類任務的架構方案。

r/LocalLLaMA top of the day10/3 04:12AI 評分43

Strata 搭配 Qwen3.8 Next 在 DDR4 平台跑出 45-70t/s

有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。

llama.cpp releases10/4 01:37AI 評分33

llama.cpp 為 WebGPU 後端加入 f16 支援

llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…

r/LocalLLaMA top of the day10/3 15:15AI 評分64

r/LocalLLaMA 熱議 Strata:Qwen 3.8 Flash Next 專用推理方案

r/LocalLLaMA 使用者集中討論名為 Strata 的推理方案,稱其是專為 Qwen 3.8 Flash Next 打造的 llama.cpp 分支,面向 12GB 以上視訊記憶體的 GPU。使用者實測在 16GB 視訊記憶體、24GB 視訊記憶體及 64GB 記憶體等配置上可執行該開源模型,有人報告解碼約 82 tok/s、60 tok/s 或 1200pp,並稱速度約為 Qwen 3.8 27B 在 llama.cpp 上的兩倍。也有人質疑相關帖子是機器人營銷,討論其是否為炒作。

llama.cpp releases10/5 09:19AI 評分12

llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤

llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。

llama.cpp releases10/3 22:09AI 評分27

llama.cpp 發布新版本,將 cpp-httplib 升級至 0.59.0

llama.cpp 發布更新,將依賴庫 cpp-httplib 升級到 0.59.0,對應 PR #29886。該版本繼續提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯建置,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 以及 Snapdragon 的 CPU、Adreno GPU 和 Hexagon NPU 等後端。

llama.cpp releases10/4 21:07AI 評分45

llama.cpp 為 x86 tinyBLAS 加入 BF16/FP16/FP32 K 尾部向量化

llama.cpp 的 ggml-cpu 後端在 x86 上為 tinyBLAS 增加了 BF16、FP16、FP32 的 K 尾部支援並做了向量化,同時讓 CPU 測試在啟用 use_ref 時跳過 tinyBLAS,以便與 vec_dot 路徑對比。改動以 PR #29806 合入,隨 b11398 建置發布,覆蓋 macOS、Linux、Windows、Android 等多平台 CPU 與 GPU 後端。

llama.cpp releases10/7 07:53AI 評分42

llama.cpp 發布 b11461,修復 AMD 核顯 Vulkan 檢查點讀取慢

llama.cpp 發布 b11461,主要改動是修復 AMD 整合顯示卡在 Vulkan 後端下檢查點(checkpoint)讀取過慢的問題,對應 PR #30049。該版本同時更新了 macOS/iOS、Linux、Android、Windows、openEuler 的預編譯包,覆蓋 Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 後端。

llama.cpp releases10/2 14:11AI 評分43

llama.cpp 為 Hexagon NPU 增加 q2_k 與 q3_k 量化支援

llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。

llama.cpp releases10/6 19:34AI 評分45

llama.cpp 建置 b11448:ggml-cuda 分塊處理大塊 BF16/FP16 轉 F32

llama.cpp 發布建置 b11448,ggml-cuda 後端把大塊 BF16/FP16 到 F32 的轉換改為分塊執行(#29442),並修正分塊 cuBLAS 矩陣乘法未遵循目標 stride 的問題,提交由 Johannes Gäßler 參與。改動僅涉及 CUDA 後端,影響用 NVIDIA GPU 做本地推理的場景;該建置同時覆蓋 macOS Apple Silicon 與 Linux、Windows 的 CUDA 12/13 等平台。

llama.cpp releases10/6 19:16AI 評分40

llama.cpp b11447 發布:新增 pplx-decider 模型支援

llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;

Simon Willison● 精選10/6 21:18AI 評分84

Mistral 發布 1 萬億引數 Mistral Large 4 預覽版

Mistral 放出 Mistral Large 4 預覽版:1 萬億總引數、490 億啟用引數,在自建 3800 塊 NVIDIA Grace Blackwell GPU 叢集上訓練。預覽版目前只通過 Mistral API 提供,官方承諾月底發布開放權重版本。該 API 僅支援 none 和 high 兩檔推理等級,high 檔生成同樣題目時用了 2717 個輸出 token,反而少於 none 檔的 3275。

NVIDIA blog● 精選10/2 00:44AI 評分85

OpenAI 上線 GPT-6 Astra Ultrafast,基於 NVIDIA Blackwell

GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放,執行在 NVIDIA Blackwell GPU 上。官方稱其 token 生成速度最高可達 Astra Standard 模式的 8 倍,可縮短 coding agent 的編輯—測試—除錯迴圈,並減少工具呼叫之間的等待。開發者可通過 API 使用,訪問方式、價格與實現細節見 Ultrafast 指南。

Google Developers blog● 精選10/6 21:40AI 評分78

EmbeddingGemma 2 發布:740M 開源多模態嵌入模型

EmbeddingGemma 2 是一個 740M 引數的開源權重多模態模型,把文字、影像、影片與音訊對映到統一向量空間,面向隱私優先的端側檢索。開發者可用 MediaPipe Tasks 跨平台整合,或通過 LiteRT 在 CPU、GPU、NPU 上做細粒度效能最佳化。模型支援邊輸入邊搜的媒體檢索、影片關鍵幀定位與零樣本意圖路由等超低延遲本地場景。