AISpot

開源

近期事件

  1. 1
    熱度 1.23 個來源 · 3 則10/3 01:45
  2. 2
    熱度 1.12 個來源 · 3 則10/3 12:44
  3. 3
    熱度 1.12 個來源 · 2 則10/3 12:28
  4. 4
    熱度 0.92 個來源 · 2 則10/3 07:27
  5. 5
    熱度 0.83 個來源 · 4 則10/3 01:56

10月4日星期日 · 1 則

  1. llama.cpp releases● 精選AI 評分63

    llama.cpp 為 WebGPU 後端加入 f16 支援

    llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。

    推薦理由:你準備用 Mac Studio 跑本地模型,llama.cpp 的 WebGPU 後端改進會直接影響瀏覽器或跨平台推理的 f16 效能與記憶體佔用。

10月3日星期六 · 10 則

  1. llama.cpp releases● 精選AI 評分78

    llama.cpp 修復 Ling 3.0 解析器對 json_schema 的支援

    llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器支援 inputs.json_schema,此前 response_format 請求不受約束。新邏輯為回應格式語法路徑優先於工具呼叫,啟用思考時要求 JSON 前有 think 塊,且 JSON 後不允許尾隨文字。該修復對應 issue #29652,由 Claude Opus 5.5 輔助完成。

    推薦理由:你在本地跑開源模型並可能用結構化輸出,這個修復直接決定 Ling 3.0 在 llama.cpp 上的 JSON 約束是否可靠。

  2. llama.cpp releases● 精選AI 評分77

    llama.cpp 修復圖重分配導致的排程中止

    llama.cpp 合併 PR #29856,把 build_rs 中分散的 get_rows 合併為一次收集全部 n_rs 個 recurrent states,使預留空間按 n_rs 最大值計算,避免 ubatch 單元不連續時在節點數不變的情況下觸發圖重分配、進而在 GGML_SCHED_NO_REALLOC 下中止。

    推薦理由:你在 Mac Studio 上用 llama.cpp 或 MLX 跑本地模型時,這類排程中止會直接讓長上下文或多序列推理崩掉,升級到 b11375 可避開該問題。

  3. llama.cpp releases● 精選AI 評分72

    llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

    llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。

    推薦理由:你在 Mac Studio 上跑本地模型時,長上下文視訊記憶體佔用和 Metal/Vulkan 後端效能會直接受益,升級 llama.cpp 即可獲得這些最佳化。

  4. r/ClaudeAI top of the day● 精選AI 評分80

    handoff-compact:自動壓縮前生成交接文件的 Claude Code 外掛

    handoff-compact 是一個 Claude Code 外掛,在 autocompact 觸發時用會話分支生成交接文件並替換原對話,實現無人值守的 handoff + /clear。作者稱長時間無人值守會話中一半 token 花在上下文已超 200k 的輪次上,既貴又因 context rot 降低品質。交接文件包含目標、狀態與驗證依據、下一步、決策與理由、已排除方案、未決問題、檔案與提交、驗證命令及最近 10 條 prompt 原文。

    推薦理由:你常用 Claude Code 跑長會話,這個外掛能在 autocompact 時自動完成 handoff + /clear,幫你省 token 並緩解上下文退化。

  5. llama.cpp releases● 精選AI 評分72

    llama.cpp 新增 clef 決策模型支援(純文字)

    llama.cpp 合併 PR #29831,為 clef 決策模型加入純文字推理支援,並更新 gguf-py 常量。該版本覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台,其中 Apple Silicon 的 KleidiAI 加速建置被停用。

    推薦理由:你準備用 Mac Studio 跑本地模型,這次更新直接關係到 llama.cpp 在 Apple Silicon 上的支援範圍與建置選項。

  6. llama.cpp releases● 精選AI 評分62

    llama.cpp 發布 b11370,CUDA 後端將共享專家融合進 MMVQ

    llama.cpp 發布建置版本 b11370,CUDA 後端新增將共享專家(shared experts)融合進 MMVQ 的改動(#29184),並修復緩衝區空值檢查、把 stride_col_dst 移入融合引數。

    推薦理由:你準備用 Mac Studio 本地跑開源模型,這次 CUDA 側的 MoE 融合最佳化雖不直接作用於 Apple Silicon,但能幫你判斷 llama.cpp 各後端迭代節奏,並留意 macOS 建置中 KleidiAI 被停用對 MLX 之外推理路徑的影響。

  7. r/LocalLLaMA top of the day● 精選AI 評分79

    llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

    llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。

    推薦理由:你準備用 Mac Studio 跑本地模型,這項改動能直接降低長上下文推理的視訊記憶體佔用,讓更多層留在 GPU 上。

  8. llama.cpp releases● 精選AI 評分80

    llama.cpp 為投機解碼加入機率取樣與拒絕取樣

    llama.cpp 合併 PR #27694,把 simple draft 與 MTP 的投機解碼改為機率取樣,目標模型用拒絕取樣驗證草稿 token。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,並支援在拒絕取樣中處理語法約束。同時修復了草稿取樣器與目標模型共用 rng 流、掩碼後分布未重歸一化等問題,並隨草稿一起截斷候選。

    推薦理由:你正為 Mac Studio 評估本地推理,這條改動直接影響 llama.cpp 在 Apple Silicon 上投機解碼的取樣正確性與速度,值得在選型時納入測試。

  9. llama.cpp releases● 精選AI 評分80

    llama.cpp 為 Metal 加入 F16 KV 的 tensor API flash attention 核心

    llama.cpp 合併 PR #29570,在 Metal 後端新增基於 tensor API 的 flash attention 核心,支援 F16 KV 快取。同一批提交還補充了 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等形狀的 tensor FA 核心,並支援 attention sinks、ALiBi 與 logit softcap。

    推薦理由:你準備用 Mac Studio 跑本地開源模型,這條直接關係到 Apple Silicon 上長上下文推理的視訊記憶體佔用與速度,可等新版 llama.cpp 發布後實測對比 MLX 與 Ollama 的表現。

  10. llama.cpp releases● 精選AI 評分68

    llama.cpp 新增 /v1/systemone API,支援 laya 等 5 個模型

    llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;

    推薦理由:你正打算在 Apple Silicon 上用 llama.cpp 跑本地模型,這次 server 新增的 systemone API、共享 prompt 字首與視覺支援,以及 KleidiAI 建置被停用的情況,都直接影響你本地推理服務的選型與部署。

10月2日星期五 · 5 則

  1. llama.cpp releases● 精選AI 評分65

    llama.cpp b11352 最佳化 qwen4exp 掩碼建置

    llama.cpp 發布 b11352 版本,主要改動是最佳化 qwen4exp 的掩碼(mask)建置(#29824),並將同一改動應用到 GLM5-next。該版本繼續提供 macOS Apple Silicon(arm64)、iOS、Linux、Windows、Android 等平台建置,涵蓋 CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 與 Snapdragon 後端。

    推薦理由:你正打算用 Mac Studio 本地跑開源模型,這版仍提供 Apple Silicon arm64 建置,但 KleidiAI 加速版被停用,升級前需留意效能差異。

  2. r/LocalLLaMA top of the day● 精選AI 評分80

    微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

    微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

    推薦理由:你可以用它的 GGUF 在 Mac Studio 上本地跑一個 4B 倉庫級編碼智慧體,但補丁必須自己審查。

  3. Hugging Face blog● 精選AI 評分65

    Ai2 開源 AstaBrief 8B 科學報告生成模型

    Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。

    推薦理由:你正打算在 Mac Studio 上跑開源模型,而 AstaBrief 就是 8B 級 Qwen 系小模型的長文生成配方,附帶的範例工作流可直接改造成本地 PDF 報告生成。

  4. X @ggerganov● 精選AI 評分82

    llama.cpp 上線 Decision 模型與 /v1/systemone 端點

    llama.cpp 最新建置已支援 Decision 模型,新增 /v1/systemone 端點,可在本地高效、私密地做 Jev 風格推理。該端點支援多個開源模型,後續還會增加。

    推薦理由:你正打算用 Mac Studio 跑本地開源模型,這條更新直接關係到 llama.cpp 的可用能力與端點用法。

10月1日星期四 · 2 則

  1. Cloudflare blog (AI)● 精選AI 評分66

    Cloudflare 開源決策模型 Clef 與 Clef-flash,並推出 RL 微調平台

    Cloudflare 在 Workers AI 上發布自研決策模型 Clef 與 Clef-flash,並以 Apache 2.0 許可在 Hugging Face 完全開源、可本地執行,同時推出可把 Clef 微調到自家場景的強化學習產品。

    推薦理由:Apache 2.0 開源意味著你可以把這兩個小模型拉到 Mac Studio 本地跑,用它替掉 agent 裡高頻的路由與分類判斷,換來遠低於 LLM 的延遲和確定性結構化輸出。

  2. Anthropic Research● 精選AI 評分68

    物理學家用 Claude 打造 BootLoops 科研工具

    理論物理學家 Matthew Schwartz 發布開源工具 BootLoops,把 Claude 當作 LLM 的"挽具",專攻適合當前 AI 的"Claude 形狀"問題。他用 Claude Fable 5 移植並改進散射振幅計算方法,還借 BootLoops 把數學物理技術帶到生態學、群體遺傳學、地質、經濟、語言學等領域,並與各領域專家合作篩選真正有價值的問題。BootLoops 開源,可搭配任意模型使用,但當前 AI 仍無法解決科學中的大多數問題。

    推薦理由:你日常用 Claude Code 等 coding agent,BootLoops 展示瞭如何按模型能力挑問題、而非硬套人類科研流程,可直接借鑑到你的 agent 工作流與本地模型實驗。