llama.cpp b11531 重構 chat API,同步更新多平台建置
llama.cpp 發布 b11531,主要變更是重構 chat API(#30210)。同步重新整理的預編譯產物覆蓋 macOS Apple Silicon、Ubuntu、Windows、Android 與 openEuler,包含 CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 版本。
依意思最接近的 18 筆
llama.cpp 發布 b11531,主要變更是重構 chat API(#30210)。同步重新整理的預編譯產物覆蓋 macOS Apple Silicon、Ubuntu、Windows、Android 與 openEuler,包含 CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO,以及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 版本。
llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。
llama.cpp 發布 b11396 版本,主要變更是 Windows 平台的 LLVM 建置需要 Ninja 多配置(#29959)。該版本提供覆蓋 macOS、Linux、Windows、Android 和 openEuler 的預編譯產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 被標記為…
llama.cpp 發布建置 b11512,首要改動是修復 DFlash 模型的輸出頭共享問題。該版本改為從 GGUF 後設資料讀取繫結的輸出權重、共享繫結的詞嵌入後設資料,並移除 DFlash 嵌入頭回退邏輯,這幾項改動均由 Codex 協助完成。
llama.cpp 發布 b11392 版本,主要變更是 CI 設定預設權限(#29945)。該版本提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯產物,包括 Apple Silicon arm64、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 等後端;
Ben Affleck 本週因多段訪談影片走紅,他在其中講解神經網路、transformer、張量等概念,並稱自己會寫點 Python。他透露做法是拿開源模型微調:解凍權重、只訓練最後一層「電影感」層,讓劇組達到製片標準,該技術已用於其電影《Animals》後期。他創立的 AI 影視公司今年被 Netflix 收購,報導金額 5.87 億美元,他本人稱這個數字不準確。他還表示不擔心 AI 接管影視業,更擔心學生的習得性無助與大學 A 成績三年上升 30%。
llama.cpp 發布 b11391 建置版本,唯一程式碼改動是將 CUDA 後端的 blocks_per_col 變數移到實際使用位置(PR #29939),由 Hugging Face 的 Adrien Gallouët 提交。
llama.cpp 建置版本 b11500 發布,主要變更是 hex-mmadd 在融合 bias-add 時不再假設讀寫記憶體對齊(#30133)。
llama.cpp 新版本 b11521 把內建 server 的預設埠改為 9931,依賴預設埠的啟動指令碼與容器埠對映需相應調整。該版本同時放出各平台預編譯包,覆蓋 macOS Apple Silicon、iOS XCFramework、Ubuntu(CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL)、Windows x64/arm64、Android,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon…
llama.cpp 建置 b11533 修復了 Adreno A6x GPU 上的 OpenCL 核心編譯崩潰,並把 Adreno 623 加入 A6X 檢測列表。具體做法是在 A6X 上跳過 kernel_cpy_f32_f32_pack——A623 的編譯器後端(E031.50.31.01)無法處理引數過多的核心;GEMV 核心裡的 get_local_size 也加了常量摺疊變通方案。
llama.cpp 發布每日建置 b11535,主要變更是 llama-bench 現在會遵循 -fitc 引數,即使該值大於基準測試所需尺寸也按使用者設定執行(PR #28331)。
llama.cpp 發布 b11539 建置,唯一程式碼改動是應用來自上游的深層巢狀 JSON 補丁(#30253)。各平台預編譯包照常提供,覆蓋 macOS/iOS、Ubuntu(CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL)、Android、Windows 以及 openEuler。其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置本次被標記為 DISABLED。
一位開發者把 AI Agent 跑在了只有 48MB RAM 的諾基亞 110 功能機上,並已用它自動化了幾個操作。他平時用這部手機來減少螢幕時間,最初嘗試刷入 Android 系統,因記憶體只有 48MB 而失敗,隨後花幾天時間逆向工程,最終讓 AI Agent 在這臺手機上執行。該帖發在 Hacker News 的 Show HN 板塊,目前 15 分、3 條評論,作者未說明所用的是哪個 AI 模型,也沒列出具體自動化了哪些操作。
llama.cpp 合併 PR #29869,為 Metal 後端新增支援 2 到 16 行 src1 的 mat-mul 核心,用於加速投機解碼中的少行矩陣乘。此前 Metal 在無 tensor API 時用 mat-vec 核心處理這些運算,耗時隨 src1 行數增長,導致 M3 Ultra 上 DFlash2 解碼慢於序列解碼。
llama.cpp 建置 b11493 為 SYCL 後端新增分組 MoE XMX GEMM 運算元(#29245),面向混合專家模型的矩陣乘加速。該版本同時放出全平台建置產物,覆蓋 macOS/iOS、Linux、Windows、Android 與 openEuler,包含 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16,以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU 組合。
OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。