AISpot

版本更新

近期事件

  1. 1
    熱度 1.12 個來源 · 2 則10/3 12:28
  2. 2
    熱度 0.82 個來源 · 2 則10/3 07:27
  3. 3
    熱度 0.83 個來源 · 4 則10/3 01:56
  4. 4
    熱度 0.72 個來源 · 2 則10/3 00:57
  5. 5
    熱度 0.61 個來源 · 2 則10/3 22:35

10月4日星期日 · 1 則

  1. llama.cpp releases● 精選AI 評分63

    llama.cpp 為 WebGPU 後端加入 f16 支援

    llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。

    推薦理由:你準備用 Mac Studio 跑本地模型,llama.cpp 的 WebGPU 後端改進會直接影響瀏覽器或跨平台推理的 f16 效能與記憶體佔用。

10月3日星期六 · 8 則

  1. llama.cpp releases● 精選AI 評分78

    llama.cpp 修復 Ling 3.0 解析器對 json_schema 的支援

    llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器支援 inputs.json_schema,此前 response_format 請求不受約束。新邏輯為回應格式語法路徑優先於工具呼叫,啟用思考時要求 JSON 前有 think 塊,且 JSON 後不允許尾隨文字。該修復對應 issue #29652,由 Claude Opus 5.5 輔助完成。

    推薦理由:你在本地跑開源模型並可能用結構化輸出,這個修復直接決定 Ling 3.0 在 llama.cpp 上的 JSON 約束是否可靠。

  2. llama.cpp releases● 精選AI 評分77

    llama.cpp 修復圖重分配導致的排程中止

    llama.cpp 合併 PR #29856,把 build_rs 中分散的 get_rows 合併為一次收集全部 n_rs 個 recurrent states,使預留空間按 n_rs 最大值計算,避免 ubatch 單元不連續時在節點數不變的情況下觸發圖重分配、進而在 GGML_SCHED_NO_REALLOC 下中止。

    推薦理由:你在 Mac Studio 上用 llama.cpp 或 MLX 跑本地模型時,這類排程中止會直接讓長上下文或多序列推理崩掉,升級到 b11375 可避開該問題。

  3. llama.cpp releases● 精選AI 評分72

    llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

    llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。

    推薦理由:你在 Mac Studio 上跑本地模型時,長上下文視訊記憶體佔用和 Metal/Vulkan 後端效能會直接受益,升級 llama.cpp 即可獲得這些最佳化。

  4. llama.cpp releases● 精選AI 評分72

    llama.cpp 新增 clef 決策模型支援(純文字)

    llama.cpp 合併 PR #29831,為 clef 決策模型加入純文字推理支援,並更新 gguf-py 常量。該版本覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台,其中 Apple Silicon 的 KleidiAI 加速建置被停用。

    推薦理由:你準備用 Mac Studio 跑本地模型,這次更新直接關係到 llama.cpp 在 Apple Silicon 上的支援範圍與建置選項。

  5. llama.cpp releases● 精選AI 評分62

    llama.cpp 發布 b11370,CUDA 後端將共享專家融合進 MMVQ

    llama.cpp 發布建置版本 b11370,CUDA 後端新增將共享專家(shared experts)融合進 MMVQ 的改動(#29184),並修復緩衝區空值檢查、把 stride_col_dst 移入融合引數。

    推薦理由:你準備用 Mac Studio 本地跑開源模型,這次 CUDA 側的 MoE 融合最佳化雖不直接作用於 Apple Silicon,但能幫你判斷 llama.cpp 各後端迭代節奏,並留意 macOS 建置中 KleidiAI 被停用對 MLX 之外推理路徑的影響。

  6. llama.cpp releases● 精選AI 評分80

    llama.cpp 為投機解碼加入機率取樣與拒絕取樣

    llama.cpp 合併 PR #27694,把 simple draft 與 MTP 的投機解碼改為機率取樣,目標模型用拒絕取樣驗證草稿 token。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,並支援在拒絕取樣中處理語法約束。同時修復了草稿取樣器與目標模型共用 rng 流、掩碼後分布未重歸一化等問題,並隨草稿一起截斷候選。

    推薦理由:你正為 Mac Studio 評估本地推理,這條改動直接影響 llama.cpp 在 Apple Silicon 上投機解碼的取樣正確性與速度,值得在選型時納入測試。

  7. llama.cpp releases● 精選AI 評分80

    llama.cpp 為 Metal 加入 F16 KV 的 tensor API flash attention 核心

    llama.cpp 合併 PR #29570,在 Metal 後端新增基於 tensor API 的 flash attention 核心,支援 F16 KV 快取。同一批提交還補充了 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等形狀的 tensor FA 核心,並支援 attention sinks、ALiBi 與 logit softcap。

    推薦理由:你準備用 Mac Studio 跑本地開源模型,這條直接關係到 Apple Silicon 上長上下文推理的視訊記憶體佔用與速度,可等新版 llama.cpp 發布後實測對比 MLX 與 Ollama 的表現。

  8. llama.cpp releases● 精選AI 評分68

    llama.cpp 新增 /v1/systemone API,支援 laya 等 5 個模型

    llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;

    推薦理由:你正打算在 Apple Silicon 上用 llama.cpp 跑本地模型,這次 server 新增的 systemone API、共享 prompt 字首與視覺支援,以及 KleidiAI 建置被停用的情況,都直接影響你本地推理服務的選型與部署。

10月2日星期五 · 4 則

  1. llama.cpp releases● 精選AI 評分65

    llama.cpp b11352 最佳化 qwen4exp 掩碼建置

    llama.cpp 發布 b11352 版本,主要改動是最佳化 qwen4exp 的掩碼(mask)建置(#29824),並將同一改動應用到 GLM5-next。該版本繼續提供 macOS Apple Silicon(arm64)、iOS、Linux、Windows、Android 等平台建置,涵蓋 CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 與 Snapdragon 後端。

    推薦理由:你正打算用 Mac Studio 本地跑開源模型,這版仍提供 Apple Silicon arm64 建置,但 KleidiAI 加速版被停用,升級前需留意效能差異。

  2. Claude Code releases● 精選AI 評分84

    Claude Code 2.1.288 修復恢復會話丟失上下文與超時中斷問題

    Claude Code 發布 v2.1.288。修復了長對話報「Prompt is too long」卻不自動壓縮、--resume 丟失剛被壓縮恢復的檔案與上下文、恢復的會話不儲存該輪最後回覆,以及回應中途 API 超時導致整輪失敗——非互動會話與子代理現在會從部分回應繼續,僅有思考內容的回應會重試。

    推薦理由:你日常依賴 Claude Code 跑長會話與子代理,這些修復直接避免 --resume 丟上下文和超時中斷整輪工作,值得儘快升級。

  3. Ollama releases● 精選AI 評分75

    Ollama v0.35.1 接入 Cloudflare 決策模型 Clef 與 Clef Flash

    Ollama v0.35.1 新增對 Cloudflare 開源決策模型 Clef(27B)與 Clef Flash(9B)的支援,通過 /v1/systemone 呼叫。兩者支援多模態,請求可同時傳入圖片與文字 state,所有 questions 共享該狀態並聯合打分,返回如 noul 機率 0.958 的答案。

    推薦理由:你在 Mac Studio 上本地跑開源模型時,可以直接用 Ollama 試這兩個多模態決策模型,並留意 llama.cpp 與 MLX 引擎更新對 Apple Silicon 推理的影響。

10月1日星期四 · 1 則

  1. Claude Code releases● 精選AI 評分78

    Claude Code v2.1.287 新增 Claude Mods 與 You should know 外掛

    Claude Code 發布 v2.1.287:新增 Claude Mods,外掛可以修改更深層行為;並內建 You should know,由側邊 agent 監視你或 Claude 可能遺漏的內容,用 /plugin enable cc-plugin-you-should-know@builtin 開啟(需第一方會話且開啟遙測)。agents 檢視新增 n:<text> 過濾器匹配會話名與任務;

    推薦理由:可以用 /plugin enable cc-plugin-you-should-know@builtin 給日常 Claude Code 會話加一層側邊 agent 複核,同時注意自建 MCP 伺服器升級後可能需要補上 bareElicitationCapability 才不會斷…

9月30日星期三 · 1 則

  1. OpenCode releases● 精選AI 評分75

    OpenCode v1.18.34 修復 macOS 27+ 本地編譯執行問題

    OpenCode 發布 v1.18.34,修復本地編譯的 macOS 二進位制在 macOS 27+ 上無法可靠執行的問題,改為編譯後重新簽名,並用 Developer ID 簽名 macOS CLI 發布版。同時模型請求現在會傳送帶名稱空間的會話與父會話身份頭,TUI 的 /status 對話方塊改用 path.sep 提取外掛名,網頁文件修正了 GPT 6.1 Sol 的快取定價。

    推薦理由:你日常用 OpenCode 且準備在 Apple Silicon 上本地跑模型,這個版本直接解決 macOS 27+ 本地編譯二進位制的簽名與執行問題,升級後本地建置更可靠。