AISpot

llama.cpp

近期事件

  1. 1
    熱度 1.12 個來源 · 2 則10/3 12:28
  2. 2
    熱度 0.82 個來源 · 2 則10/3 07:27
  3. 3
    熱度 0.83 個來源 · 4 則10/3 01:56
  4. 4
    熱度 0.72 個來源 · 2 則10/3 00:57
  5. 5
    熱度 0.61 個來源 · 2 則10/3 22:35

10月4日星期日 · 1 則

  1. llama.cpp releases● 精選AI 評分63

    llama.cpp 為 WebGPU 後端加入 f16 支援

    llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。

    推薦理由:你準備用 Mac Studio 跑本地模型,llama.cpp 的 WebGPU 後端改進會直接影響瀏覽器或跨平台推理的 f16 效能與記憶體佔用。

10月3日星期六 · 9 則

  1. llama.cpp releases● 精選AI 評分78

    llama.cpp 修復 Ling 3.0 解析器對 json_schema 的支援

    llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器支援 inputs.json_schema,此前 response_format 請求不受約束。新邏輯為回應格式語法路徑優先於工具呼叫,啟用思考時要求 JSON 前有 think 塊,且 JSON 後不允許尾隨文字。該修復對應 issue #29652,由 Claude Opus 5.5 輔助完成。

    推薦理由:你在本地跑開源模型並可能用結構化輸出,這個修復直接決定 Ling 3.0 在 llama.cpp 上的 JSON 約束是否可靠。

  2. llama.cpp releases● 精選AI 評分77

    llama.cpp 修復圖重分配導致的排程中止

    llama.cpp 合併 PR #29856,把 build_rs 中分散的 get_rows 合併為一次收集全部 n_rs 個 recurrent states,使預留空間按 n_rs 最大值計算,避免 ubatch 單元不連續時在節點數不變的情況下觸發圖重分配、進而在 GGML_SCHED_NO_REALLOC 下中止。

    推薦理由:你在 Mac Studio 上用 llama.cpp 或 MLX 跑本地模型時,這類排程中止會直接讓長上下文或多序列推理崩掉,升級到 b11375 可避開該問題。

  3. llama.cpp releases● 精選AI 評分72

    llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

    llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。

    推薦理由:你在 Mac Studio 上跑本地模型時,長上下文視訊記憶體佔用和 Metal/Vulkan 後端效能會直接受益,升級 llama.cpp 即可獲得這些最佳化。

  4. llama.cpp releases● 精選AI 評分72

    llama.cpp 新增 clef 決策模型支援(純文字)

    llama.cpp 合併 PR #29831,為 clef 決策模型加入純文字推理支援,並更新 gguf-py 常量。該版本覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台,其中 Apple Silicon 的 KleidiAI 加速建置被停用。

    推薦理由:你準備用 Mac Studio 跑本地模型,這次更新直接關係到 llama.cpp 在 Apple Silicon 上的支援範圍與建置選項。

  5. llama.cpp releases● 精選AI 評分62

    llama.cpp 發布 b11370,CUDA 後端將共享專家融合進 MMVQ

    llama.cpp 發布建置版本 b11370,CUDA 後端新增將共享專家(shared experts)融合進 MMVQ 的改動(#29184),並修復緩衝區空值檢查、把 stride_col_dst 移入融合引數。

    推薦理由:你準備用 Mac Studio 本地跑開源模型,這次 CUDA 側的 MoE 融合最佳化雖不直接作用於 Apple Silicon,但能幫你判斷 llama.cpp 各後端迭代節奏,並留意 macOS 建置中 KleidiAI 被停用對 MLX 之外推理路徑的影響。

  6. r/LocalLLaMA top of the day● 精選AI 評分79

    llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

    llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。

    推薦理由:你準備用 Mac Studio 跑本地模型,這項改動能直接降低長上下文推理的視訊記憶體佔用,讓更多層留在 GPU 上。

  7. llama.cpp releases● 精選AI 評分80

    llama.cpp 為投機解碼加入機率取樣與拒絕取樣

    llama.cpp 合併 PR #27694,把 simple draft 與 MTP 的投機解碼改為機率取樣,目標模型用拒絕取樣驗證草稿 token。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,並支援在拒絕取樣中處理語法約束。同時修復了草稿取樣器與目標模型共用 rng 流、掩碼後分布未重歸一化等問題,並隨草稿一起截斷候選。

    推薦理由:你正為 Mac Studio 評估本地推理,這條改動直接影響 llama.cpp 在 Apple Silicon 上投機解碼的取樣正確性與速度,值得在選型時納入測試。

  8. llama.cpp releases● 精選AI 評分80

    llama.cpp 為 Metal 加入 F16 KV 的 tensor API flash attention 核心

    llama.cpp 合併 PR #29570,在 Metal 後端新增基於 tensor API 的 flash attention 核心,支援 F16 KV 快取。同一批提交還補充了 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等形狀的 tensor FA 核心,並支援 attention sinks、ALiBi 與 logit softcap。

    推薦理由:你準備用 Mac Studio 跑本地開源模型,這條直接關係到 Apple Silicon 上長上下文推理的視訊記憶體佔用與速度,可等新版 llama.cpp 發布後實測對比 MLX 與 Ollama 的表現。

  9. llama.cpp releases● 精選AI 評分68

    llama.cpp 新增 /v1/systemone API,支援 laya 等 5 個模型

    llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;

    推薦理由:你正打算在 Apple Silicon 上用 llama.cpp 跑本地模型,這次 server 新增的 systemone API、共享 prompt 字首與視覺支援,以及 KleidiAI 建置被停用的情況,都直接影響你本地推理服務的選型與部署。

10月2日星期五 · 5 則

  1. llama.cpp releases● 精選AI 評分65

    llama.cpp b11352 最佳化 qwen4exp 掩碼建置

    llama.cpp 發布 b11352 版本,主要改動是最佳化 qwen4exp 的掩碼(mask)建置(#29824),並將同一改動應用到 GLM5-next。該版本繼續提供 macOS Apple Silicon(arm64)、iOS、Linux、Windows、Android 等平台建置,涵蓋 CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 與 Snapdragon 後端。

    推薦理由:你正打算用 Mac Studio 本地跑開源模型,這版仍提供 Apple Silicon arm64 建置,但 KleidiAI 加速版被停用,升級前需留意效能差異。

  2. Ollama releases● 精選AI 評分75

    Ollama v0.35.1 接入 Cloudflare 決策模型 Clef 與 Clef Flash

    Ollama v0.35.1 新增對 Cloudflare 開源決策模型 Clef(27B)與 Clef Flash(9B)的支援,通過 /v1/systemone 呼叫。兩者支援多模態,請求可同時傳入圖片與文字 state,所有 questions 共享該狀態並聯合打分,返回如 noul 機率 0.958 的答案。

    推薦理由:你在 Mac Studio 上本地跑開源模型時,可以直接用 Ollama 試這兩個多模態決策模型,並留意 llama.cpp 與 MLX 引擎更新對 Apple Silicon 推理的影響。

  3. X @ggerganov● 精選AI 評分82

    llama.cpp 上線 Decision 模型與 /v1/systemone 端點

    llama.cpp 最新建置已支援 Decision 模型,新增 /v1/systemone 端點,可在本地高效、私密地做 Jev 風格推理。該端點支援多個開源模型,後續還會增加。

    推薦理由:你正打算用 Mac Studio 跑本地開源模型,這條更新直接關係到 llama.cpp 的可用能力與端點用法。

  4. NVIDIA blog● 精選AI 評分72

    NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

    NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

    推薦理由:如果你在 Mac Studio 之外考慮本地跑開源模型,這是同價位可對比的 CUDA 方案,且開箱即支援 Ollama、llama.cpp、LM Studio,並能一鍵把本地模型接給 OpenCode 用。