llama.cpp b11436 修復 OpenVINO 後端多項 GPU 迴歸
llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;
找到 15 筆
llama.cpp b11436 修復 ggml-openvino 後端的 CI 測試失敗與多項 GPU 迴歸。上游 #29622 給輸入 embedding 圖加入混合 token/embd 分支,後端改為只從計算節點建置 OV 模型,並把同型別連續 DUP 按 CONT 翻譯以避免圖被拆分,修復了 CPU 與 GPU 上首個單 token decode 失敗;
llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。
Latent Space 播客本期嘉賓為 MIT 的 Alex Zhang,他是 Recursive Language Models(RLM)的作者,也是 GPU Mode 社群成員。
DeepSeek 官方表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署方案。官方同時提出可承接 2000 塊 GPU 加儲存叢集的大規模部署需求,並附上模型與論文連結。
llama.cpp 發布 b11346 版本,主要變更是修復 qwen4exp 的測試(#29819)。該版本為 macOS、iOS、Linux、Android、Windows 和 openEuler 提供預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 及 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端;
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。
llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…
llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。
llama.cpp 的 ggml-cpu 後端在 x86 上為 tinyBLAS 增加了 BF16、FP16、FP32 的 K 尾部支援並做了向量化,同時讓 CPU 測試在啟用 use_ref 時跳過 tinyBLAS,以便與 vec_dot 路徑對比。改動以 PR #29806 合入,隨 b11398 建置發布,覆蓋 macOS、Linux、Windows、Android 等多平台 CPU 與 GPU 後端。
llama.cpp 發布 b11489,為 Hexagon NPU 的 Q6_K 權重反量化帶來加速,做法是再增加 2 倍迴圈展開,改動由 OpenCode 協助完成。該版本繼續提供 macOS/iOS、Linux、Android、Windows 多平台預編譯包,Snapdragon 版本可分別使用 CPU、Adreno GPU 與 Hexagon NPU,Windows arm64 另有 OpenCL Adreno 建置;
Mistral 於 10 月 6 日開啟 Mistral Large 4 公開預覽,可在 Mistral Studio 呼叫 API,權重本月底放出。模型為 1 萬億引數原生多模態、49B 啟用引數,在歐洲自有資料中心用 3800 張 NVIDIA Grace Blackwell GPU 從零訓練。官方稱其在 Artificial Analysis Cyber Index 位列全球前五,漏洞復現並修補測試得 82% 為所有模型最高,Cybench 解決 93%;
ArtCraft 發布 PhotoCraft:一個以潔淨室方式從零重寫、純 Rust 編寫的開源 Photoshop 替代品,可開啟、編輯並儲存分層 PSD 檔案。它採用基於 wgpu 的 GPU 合成器(Metal、Vulkan、DX12、WebGPU)與多執行緒濾鏡,內建 34 個工具和 16 種可即時疊加的調整圖層,重存 PSD 時保留 psd-tools 全部 309 個測試檔案中 307 個的渲染,116 個向量形狀圖層與 Photoshop 畫素一致。
EmbeddingGemma 2 是一個 740M 引數的開源權重多模態模型,把文字、影像、影片與音訊對映到統一向量空間,面向隱私優先的端側檢索。開發者可用 MediaPipe Tasks 跨平台整合,或通過 LiteRT 在 CPU、GPU、NPU 上做細粒度效能最佳化。模型支援邊輸入邊搜的媒體檢索、影片關鍵幀定位與零樣本意圖路由等超低延遲本地場景。
輝達 Inception 計劃的多家初創公司正用 AI 補乳腺癌篩查、風險評估與治療規劃的缺口。iSono Health 的 FDA 許可 ATUSA 可穿戴自動 3D 超聲每側乳房約 2 分鐘完成成像,傳統手持超聲最長需 45 分鐘,其敏感度稱高出 28%,已在加州、德州等地診所商用,並啟動 3200 人臨床研究。Whiterabbit.ai 的 FDA 許可 WRDensity 軟體自動評估乳腺密度,已用於數十萬患者;
法國 AI 實驗室 Mistral 於週二發布 1 萬億引數多模態模型 Mistral Large 4(ML4),暱稱 Le Chonk。它暫不是開放權重模型,只能通過公開的 guardrail 端點訪問,Mistral 計劃三週內完成安全測試後放出權重。該模型全程用自家算力訓練,僅 4000 塊 Nvidia GPU,官方稱比中國競爭對手少兩到三倍。基準結果未公布,最佳化場景包括網路安全、金融和晶片設計;三星上月以 210 億歐元估值領投其 D 輪。