llama.cpp 新 PR 將共享專家融合進 MMVQ,部分 MoE 架構提速
llama.cpp 的 PR #29184 提出在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構帶來提速,例如 Qwen 35B A3B。有評論稱該改動使 TG 速度提升約 5%,並指出僅對部分 MoE 架構有效。
找到 30 筆
llama.cpp 的 PR #29184 提出在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構帶來提速,例如 Qwen 35B A3B。有評論稱該改動使 TG 速度提升約 5%,並指出僅對部分 MoE 架構有效。
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
llama.cpp 合併 PR #29860,新增 common_is_tty() 輔助函式並修復 Windows 上的棄用警告,由 Hugging Face 的 Adrien Gallouët 提交。
llama.cpp 發布 b11391 建置版本,唯一程式碼改動是將 CUDA 後端的 blocks_per_col 變數移到實際使用位置(PR #29939),由 Hugging Face 的 Adrien Gallouët 提交。
Cursor 於 2026 年 8 月 19 日更新雲代理與 harness,雲代理現可訂閱事件源:監控 PR、Slack 執行緒或定時任務,事件發生時自動喚醒並持續推進,直到目標完成。雲代理會自動訂閱自己建立的 PR,修復 CI 並處理機器人評論;在 Slack 中可用 @cursor 要求一小時後回來檢查。此外新增自訂模式(把技能固定在對話中)、子代理獨立虛擬機器、/goal 長期目標指令,以及不打斷代理的即時引導。訂閱功能目前僅限雲代理。
llama.cpp 發布 b11387 版本,修復了在截斷後溫度大於 0 時 n-gram 草稿被拒絕的問題(PR #29924),由 NVIDIA 的 Pranesh Gonegandla 參與提交。
llama.cpp 發布 b11364 版本,新增對 nimble 決策模型的支援(PR #29844)。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL、Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端建置;
llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…
llama.cpp 合併 PR #29903,通過將 n_batch 限制為不超過 n_ubatch 來修復 server 崩潰問題,對應 issue #29902。該修復由 Claude 輔助完成,並移除了相關測試與 embeddings 條件。新版本已覆蓋 macOS、Linux、Windows、Android 等平台,包括 Apple Silicon、CUDA、ROCm、Vulkan 等後端。
llama.cpp 合併 PR #29831,為 clef 決策模型加入初始支援,目前僅限純文字輸入。該改動同時更新了 gguf-py 常量並清理了靜態圖相關程式碼,隨附的建置產物覆蓋 macOS、Linux、Windows、Android 與 openEuler 等多個平台。
llama.cpp 合併 PR #28531,在共享記憶體為 32KB 的三星 GPU 上停用 Vulkan 後端的大矩陣乘分塊(large matmul tile),以規避該硬體配置下的問題。該改動由 Claude Opus 輔助完成,並附有建置證明連結。
llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。
llama.cpp 發布更新,將依賴庫 cpp-httplib 升級到 0.59.0,對應 PR #29886。該版本繼續提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯建置,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 以及 Snapdragon 的 CPU、Adreno GPU 和 Hexagon NPU 等後端。
llama.cpp 合併 PR #29570,在 Metal 後端為 F16 KV 快取加入基於張量 API 的 flash attention 核心。該核心覆蓋 DK=DV=512、DK=576/DV=512、DK=192/DV=128 等配置,並支援 attention sinks、ALiBi 與 logit softcap。改動隨 b11362 建置發布,覆蓋 macOS Apple Silicon、iOS 及 Linux、Windows、Android 等多平台建置。
llama.cpp 合併 PR #29904,通過改用融合 ADD 容差修復 f16 下 ADD_ADD 測試的 flaky 問題。隨附的建置覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 及 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 版本和 openEuler 被標記為 DISABL…
llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。
llama.cpp 合併 PR #29828,為高通 Hexagon NPU 安裝重建的 HTP skels,並修復 HTP skel 目錄依賴。該改動面向在驍龍裝置上通過 Hexagon NPU 執行本地推理的使用者,涉及 Linux arm64 與 Android arm64 的 Snapdragon 建置。相關建置產物已隨本次發布提供,並附有 attestations 連結。
llama.cpp 合併 PR #29794,為 Vulkan 後端的管線編譯問題新增日誌輸出,便於定位著色器編譯失敗。該改動隨 b11349 版本發布,覆蓋 Ubuntu 與 Windows 的 x64 Vulkan 建置,同時該版本繼續提供 macOS Apple Silicon、CUDA 12/13、ROCm 10.0、SYCL、OpenVINO 等平台建置。
llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。
llama.cpp 合併 PR #14891,為 GGUF 格式 imatrix 引入基於啟用值的統計計算,新增 --activation-statistics 引數。該功能可計算啟用熵、餘弦相似度、L2 範數及歐氏-餘弦分數(ECS),並支援外部 NextN 草稿檔案(-md / --model-draft)。預設不啟用啟用統計以避免 imatrix 體積翻倍,統計報告佈局與排序也按 imatrix 型別更新。
llama.cpp 合併 PR #27096,修復 ggml-cpu 後端 GGML_OP_SOFT_MAX_BACK 在 dst 與 src1(y)別名時輸出靜默錯誤的問題:原實現先覆蓋 y 再讀取,導致結果錯誤。補丁改為單次融合迴圈,先讀兩個輸入再寫出,並新增迴歸測試強制觸發該別名。CUDA 核心因先完成歸約再寫出,不受影響。
一位寫了 18 年程式碼的開發者表示,自去年在 Claude Code 中使用 Opus 4.5 後,用自然語言描述需求比手寫程式碼更快,於是徹底停止了手寫程式碼。他所在的 Filestage 團隊月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。
LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。
llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器開始遵循 inputs.json_schema。此前 Ling 3.0 只為工具呼叫建置語法,response_format 請求不受約束;新實現加入優先於工具的回應格式語法路徑,並在啟用思考時要求先輸出 think 塊、JSON 回應後不允許追加散文。該修復對應 issue #29652,隨新版建置覆蓋 macOS、Linux、Windows、Android 等平台。
llama.cpp 合併 PR #29817,修復 ggml-quants 中 qkx3 量化縮放搜尋的非法舍入問題:當 imatrix 擬合的最小值塌縮為最大值或範圍極小時,會產生無窮、NaN 或越界值,傳入 nearest_int 後可能觸發 Debug 建置斷言。修復方式是在舍入前把量化級別鉗制到 [0, nmax],並新增 q2_K、q4_K、q5_K、q4_1、q5_1 的退化 imatrix 組迴歸測試,對應 issue #29804。
llama.cpp 合併 PR #29856,將迴圈狀態改為一次 get_rows 收集,ubatch 狀態與額外狀態都作為其檢視,節點大小隻取決於 n_rs,而 reserve 已將其設為最大值。此前 build_rs 用獨立 get_rows 收集 n_rs - n_seqs 行額外狀態,最壞情況下該節點被設為 0 行,非連續 ubatch 會在節點數不變時觸發圖重分配,進而在 GGML_SCHED_NO_REALLOC 下中止。
Anthropic 於 2026 年 6 月 18 日宣布 Claude Code 支援 artifacts,能把會話中的工作進度轉成可即時更新、可分享的互動式網頁,如 PR 講解、系統說明、儀表盤和發布清單。artifacts 基於會話完整上下文建置,涵蓋程式碼庫、聯結器和對話本身,無需自行接入資料來源或搭建基礎設施;頁面原地重新整理,同一連結發布新版本並保留版本歷史。
llama.cpp 合併 PR #27694,為 simple draft 與 MTP 推測解碼引入機率取樣:草稿端按機率取樣,目標模型用拒絕取樣驗證,並修復草稿取樣器與目標模型共用 RNG 流等問題。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,同時支援在拒絕取樣中處理語法約束。改動由 NVIDIA 工程師參與提交,隨各平台建置一同發布。
Mistral 為一家歐洲能源運營商將 4 萬行 Fortran 77 編寫的油藏模擬器遷移到 C++,該程式碼庫沒有測試套件和集中文件。做法是先建置數值一致性校驗框架,再用 Vibe CLI 排程上百個 agent 逐節點生成文件並提交 PR,由審查 agent 定時複核。首次嘗試讓 agent 完全自主翻譯,結果只是把 Fortran 按 C++ 語法重寫,COMMON 塊和 GOTO 控制流原樣保留,未實現真正的現代化重構。
Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。