AISpot

搜尋

依意思最接近的 30 筆

llama.cpp releases10/7 01:02AI 評分36

llama.cpp 發布 b11459:ggml-webgpu 在 WASI 上停用 Dawn 原生特性

llama.cpp 發布建置 b11459,唯一列出的程式碼改動是 ggml-webgpu 在 WASI 上不再啟用 Dawn 原生特性。該建置的預編譯產物覆蓋 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework、Linux、Android、Windows 以及 openEuler。後端包括 CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO 與 SYCL;

llama.cpp releases10/3 20:37AI 評分33

llama.cpp 為 WebGPU 後端加入 f16 支援

llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…

llama.cpp releases10/6 02:57AI 評分45

llama.cpp b11436 修復 OpenVINO 後端多項 GPU 迴歸

llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;

llama.cpp releases10/7 07:52AI 評分42

llama.cpp b11466 修復 WebGPU flash_attn 的 KV 重疊檢查

llama.cpp 發布 b11466,唯一程式碼改動是修復 ggml-webgpu 後端 flash_attn 對 KV 重疊情形的 supports_op 檢查(#28205)。該版本同步更新各平台預編譯包,涵蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,後端包括 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU;

llama.cpp releases10/6 14:51AI 評分46

llama.cpp 修復 ggml CLAMP 非連續檢視定址錯誤

ggml 修復了 CLAMP 運算元在非連續檢視上的定址錯誤,涉及 CPU 與 CUDA 後端。CUDA 此前按 ggml_nelements 做平坦處理、忽略檢視 stride,CPU 則把第 j 行按 j*nb01 定址、忽略 nb02/nb03;現在兩者都改為遵循 dims 1..3 的 stride,且 CUDA 的 supports_op 要求行連續,與 Metal 一致。

llama.cpp releases● 精選10/3 07:54AI 評分70

llama.cpp 的 OpenVINO 後端更新至 2026.4.1 並大幅最佳化 MoE 效能

ggml-openvino 後端更新到 2026.4.1,重點最佳化 Qwen3.5 MoE 推理效能,並新增推理效能分析、預設使用遠端輸出張量、磁碟快取模型直載(cache_only)等能力。在 Arc B390 上以 q4_asym64_all 重量化執行 gemma-4-26B-A4B,pp512 從 66.16 t/s 提升到 1608.73 t/s,tg128 從 25.94 提升到 26.46 t/s,困惑度基本不變。

X @ggerganov10/7 13:52AI 評分62

llama.cpp 借 ggml RPC 後端實現異構裝置分散式推理

llama.cpp 現在可以通過 ggml RPC 後端,把推理任務分散到異構裝置上共同完成,即同一次推理可由不同型別的硬體一起承擔。llama.cpp 作者 Georgi Gerganov 說明,這一能力目前仍是進階設定,但會隨時間逐步降低使用門檻,讓普通使用者也能用上。原文未給出支援的具體硬體組合、效能表現或可用版本。

Hacker News front page● 精選10/6 12:03AI 評分85

Google 發布 EmbeddingGemma 2,740M 引數開源端側多模態嵌入模型

Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。

llama.cpp releases10/2 14:55AI 評分45

llama.cpp 為 ggml 後端緩衝區介面新增 alloc_buffer_n

llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 方法,並公開 API ggml_backend_buft_alloc_buffer_n,同時加入 get_alloc_size_n 與配套測試。預設實現負責多緩衝區拆分與張量分配,Meta 緩衝區型別提供按裝置建立子上下文的自訂實現;cpu、metal、openvino、hexagon、webgpu 等現有後端介面先置為 NULL。

X @GoogleDeepMind● 精選10/6 12:04AI 評分80

@GoogleDeepMind: At 740M parameters, it’s competitive across benchmarks – even outperforming some specialist models …

Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。

llama.cpp releases10/7 07:11AI 評分42

llama.cpp 修復 SYCL 混用不同型號 GPU 的 FA 問題

llama.cpp 合併 PR #29071,修復 SYCL 後端在 Flash Attention(FA)中混用不同型號 GPU 時出現的問題。改動位於 ggml/src/ggml-sycl/ggml-sycl.cpp,提交由 Georgi Gerganov 共同署名。該修復包含在版本 b11464 中,此版本同時提供 Ubuntu x64(SYCL FP32、FP16)與 Windows x64(SYCL)等建置。

llama.cpp releases10/6 14:34AI 評分45

llama.cpp 建置 b11448:ggml-cuda 分塊處理大塊 BF16/FP16 轉 F32

llama.cpp 發布建置 b11448,ggml-cuda 後端把大塊 BF16/FP16 到 F32 的轉換改為分塊執行(#29442),並修正分塊 cuBLAS 矩陣乘法未遵循目標 stride 的問題,提交由 Johannes Gäßler 參與。改動僅涉及 CUDA 後端,影響用 NVIDIA GPU 做本地推理的場景;該建置同時覆蓋 macOS Apple Silicon 與 Linux、Windows 的 CUDA 12/13 等平台。

llama.cpp releases● 精選10/7 06:43AI 評分68

llama.cpp SYCL 為 GLM MLA 預填充接入 MKL,pp8192 提速 2.99 倍

llama.cpp 的 SYCL 後端放行了 GLM-4.7 Flash 的 MLA 形狀走 MKL flash attention,此前該形狀因 K/V 寬度不一致、head dim 上限 512 被排程器拒絕,預填充只能回退到更慢的 TILE kernel。在 Intel Arc Pro B70 上,pp8192 從 432.80 提升到 1292.29 tok/s(2.99 倍,+198.6%),tg256 在噪聲範圍內基本不變(45.67 對 45.65)。

X @GoogleDeepMind● 精選10/6 12:04AI 評分73

@GoogleDeepMind: Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings.

Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。

X @ollama● 精選10/6 17:32AI 評分65

@ollama: .@GoogleDeepMind EmbeddingGemma 2 is now available on Ollama.

Google DeepMind 的 EmbeddingGemma 2 已上線 Ollama,執行 ollama pull embeddinggemma-2 即可拉取。訊息由 Ollama 官方帳號在 10 月 6 日發布,官方稱該模型面向消費級裝置,並且是多模態模型。原文未披露模型體積、上下文長度與具體支援的模態等細節。

llama.cpp releases10/4 16:07AI 評分45

llama.cpp 為 x86 tinyBLAS 加入 BF16/FP16/FP32 K 尾部向量化

llama.cpp 的 ggml-cpu 後端在 x86 上為 tinyBLAS 增加了 BF16、FP16、FP32 的 K 尾部支援並做了向量化,同時讓 CPU 測試在啟用 use_ref 時跳過 tinyBLAS,以便與 vec_dot 路徑對比。改動以 PR #29806 合入,隨 b11398 建置發布,覆蓋 macOS、Linux、Windows、Android 等多平台 CPU 與 GPU 後端。

llama.cpp releases10/5 04:19AI 評分12

llama.cpp 發布 b11407,修復 Vulkan 測試編譯錯誤

llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。

Google DeepMind blog● 精選10/6 15:57AI 評分85

Google 發布 740M 引數開源多模態嵌入模型 EmbeddingGemma 2

Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,可把文字、程式碼、影像、音訊、影片對映到同一嵌入空間。它基於 Gemma 4 架構,可拆分出 270M 純文字、170M 視覺與 300M 音訊編碼器,並用 MRL 把輸出向量從 768 維截斷到 128 維,本地向量庫儲存最多省 6 倍。

Hacker News front page● 精選10/6 17:20AI 評分78

Google 發布 EmbeddingGemma 2,統一五種模態嵌入

Google 發布 EmbeddingGemma 2,一個把文字、程式碼、影像、影片和音訊對映到同一嵌入空間的多模態嵌入模型。它採用 740M 引數與模組化編碼器,面向端側場景最佳化;藉助 Matryoshka 表示學習支援 768 到 128 維的靈活維度,上下文視窗 8K,是純文字版 EmbeddingGemma 的 4 倍,並以 Apache 2.0 許可開放商用。

Ollama releases● 精選10/6 14:47AI 評分82

Ollama v0.40.0:Apple Silicon 預設用 MLX 執行模型

Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8,其他可用模型還包括 gemma4、qwen3.6 和 qwen3.5;決策模型 Nimble、tev1、clef、clef-flash 也已支援 MLX,並新增嵌入模型 embeddinggemma-2 支援。官方表示會繼續測試並啟用更多模型。

X @ollama10/6 17:32AI 評分42

@ollama: @GoogleDeepMind Model page:

Ollama 模型庫新增 Google DeepMind 的 embeddinggemma-2 頁面,地址為 ollama.com/library/embeddinggemma-2,使用者可通過 Ollama 拉取該嵌入模型。該條目由 Ollama 官方帳號發布,指向 Google DeepMind 的這一模型。原文未給出模型規模、上下文長度、許可證或效能資料等細節。

llama.cpp releases● 精選10/7 10:59AI 評分62

llama.cpp Metal 把 few-row MMA 核心擴充套件到 BF16、MXFP4 等型別

llama.cpp 的 Metal 後端將通用 few-row MMA 矩陣乘法核心擴充套件到更多權重量化型別,BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0 及 IQ 系列現已納入。該核心適用於任何帶 16-weight 反量化器的型別,各型別從在 M3 Ultra 上能勝過現有核心的行數起啟用:TQ2_0 為 5 行,BF16 為 4 行,MXFP4、Q2_0、Q2_K、IQ4_NL 為 3 行,其餘為 2 行。