llama.cpp 為 WebGPU 後端加入 f16 支援
llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。
llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。
AWS 在 9 月 16 日推出月度支出上限功能,專案用量達到上限後當月暫停;Google Cloud 則在 7 月上線 Spend Caps,可對專案內特定服務設定月度財務上限。作者認為按量付費的 API 與託管服務應預設開啟硬性預算上限,而非只發警告郵件,因為 coding agent 會大幅降低啟動付費服務的門檻,可能在你睡覺時燒掉數百甚至上萬美元。AWS 該功能目前僅向少量客戶開放,尚未全面可用。
Claude Code 更新至 v2.1.289,集中修復外掛系統、沙箱權限規則與終端渲染的多個缺陷。其中 Bash 拒絕或詢問規則此前在環境變數字首、裸變數賦值及沙箱自動放行場景下會被跳過,Read 拒絕規則也未覆蓋通過符號連結在 IDE 中 @ 提及或選中的檔案。此外還修復了外掛熱過載、本地資料夾市場外掛顯示陳舊副本、升級後首個會話不載入已安裝 mod,以及 VSCode 中 claude auth status 導致登出更頻繁的回退問題。
微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。
一位寫了 18 年程式碼的工程師表示,自 Claude Code 中的 Opus 4.5 越過某個門檻後,他幾乎不再手寫程式碼,並認為回不去了。他所在團隊 Filestage 每月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。他仍主張保留高階抽象,認為 LLM 應生成高階表示再交給確定性編譯器,而非直接寫彙編。
llama.cpp 發布 b11381 版本,修復了 mtmd 在 Windows 上觸發的 strdup 棄用警告(#29863),由 Hugging Face 的 Adrien Gallouët 提交。該版本繼續提供 macOS Apple Silicon(arm64)、Linux、Windows、Android 等多平台預編譯包,其中 macOS Apple Silicon 的 KleidiAI 加速版被標記為 DISABLED。
llama.cpp 發布 b11380 版本,將依賴庫 cpp-httplib 升級到 0.59.0。該版本繼續為 macOS Apple Silicon(arm64)、Linux、Windows、Android 等平台提供預編譯建置,其中 macOS Apple Silicon 的 KleidiAI 加速版本被標記為 DISABLED。
一位使用者在 r/ClaudeAI 分享用 Claude 生成 106 張以黑色為主的 4K OLED 桌布,圖形全部由真實科學資料或物理數學方程模擬後以程式碼渲染,未使用影像生成。作者稱 AI 只用於寫程式碼,成品針對 OLED 全黑畫素最佳化,已發布在 alistair-roberts.co.uk。
一位 Home Assistant 使用者用 DW3000 UWB 開發板和六個電池標籤搭出 BinRange,判斷垃圾桶是否被推到存放區外,從而確認有沒有真的把垃圾拿出去。實驗顯示,10.1 米距離下平均讀數約 10.09 米、標準差 3 釐米;天線從平放改為豎立後,約十米處的成功率從 37% 升到 100%。整個專案用 Codex 輔助開發,包含自製韌體、3D 列印外殼和無線更新,但邊界和精度都針對他自己的安裝環境。
Jeffy 是一個本地執行的簡單分類器集合,無需 GPU,在普通電腦上即可使用,自帶 13 個已訓練好的分類器,覆蓋垃圾郵件檢測、意圖路由、主題分類、情感分析,甚至能玩 Doom。使用者還可以用它訓練自己的分類器,作者表示這種架構上還能搭建更多應用,並希望瞭解大家覺得哪些任務有用、類似任務用什麼架構。
一位使用者稱 Codex 的生成速度比 Claude 慢約 10 倍,且其 harness 在通過 subagent 並行處理任務時表現很差。該使用者表示自己持有 4 個 Claude Max 方案,另購了一個 ChatGPT 方案想探索 astra,但認為 Codex 在實際工作中完全派不上用場。
開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。
Cloudflare 宣布 Artifacts 進入公開測試,並舉辦比賽,邀請開發者用 Workers 和 Artifacts 建置面向 agent 的下一代 Git 平台。Artifacts 是可程式設計的版本化檔案系統,支援 Git 操作、程式化建立和 fork 倉庫,可擴充套件到數百萬倉庫。
有使用者在 macOS 版 ChatGPT 桌面應用(版本 26.930.31730,Apple Silicon)遇到 PDF 附件訪問異常:同一 PDF 用“On the computer”可讀,用“Run on the cloud”卻取不到;把會話移入專案後,通過上傳 ID 下載 PDF 報“file could not be authorized or resolved”,本地附件目錄仍可正常讀取並提取兩頁,且所選專案與活動工作區目錄不一致。
創作者 Marcello Costa 發布 AI 動畫短片 Monkey Business,全流程幾乎都在 Claude 內完成,約 50 天從開工到成片。他用自建的 Seedance 2.5 skill 把自然語言提示轉成詳細視覺提示,再交給 Magnific 裡的 Seedance 2.5 生成畫面,首條提示寫入了整套專案規則,之後靠術語呼叫即可銜接,但仍需大量迭代和後期製作才達到專業水準。
開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。
一位 ChatGPT Pro 訂閱使用者在 Reddit 發帖質疑 dots 功能的價值:連線外部服務時頻繁失敗,至少一半時間直接告知無法完成,且拒絕說明原因;連線本地 PC 瀏覽器時持續報錯,而同樣的瀏覽器在普通 Codex 和聊天會話中每天都能正常連線。該使用者還抱怨 Pro 帳戶的用量因此被削減了一半。
Anthropic 於 2026 年 9 月發布 Opus 5.5 官方使用指南,作者 Addy Osmani,閱讀時長 9 分鐘。Opus 5.5 相比前代更擅長多步驟長任務,可連續數小時執行大型倉庫改動直至測試通過,且每次回覆前都會自行思考。指南建議一次性交代完整任務並說明完成標準,刪除提示詞中的 think carefully 等語句,在 CLAUDE.md 中寫明何時繼續、何時停下詢問,並讓子代理並行處理審計與遷移。
Opus 5.5 幾乎完全自主地製作了一支兩分鐘的“四年 AI 回顧”影片。作者只提供了創意、工作資料夾和音樂檔案,模型自行檢索四年 AI 資料、尋找素材與截圖、編寫 HTML 與動畫程式碼、用 Playwright 渲染場景、用 FFmpeg 合成並加入音效,最終輸出成片。
一位工程師用 Claude 驅動掃描器並自動完成膠片負片轉正、除塵與調色,把每卷 36 張的處理時間從約 4 小時壓縮下來。Claude 通過 SANE 控制掃描器時因 X/Y 方向反轉幾乎損壞齒輪機構,他最終保留 VueScan 負責掃描,讓 Claude 接手後續處理。負片轉換用 numpy 按膠片密度計算,並以每卷空白片頭作為色彩校正參考,29 幀中 28 幀通過測試。除塵用影像分析標記灰塵,再用 LaMa 修復模型填補。
有人用 Claude Code 建置了義大利 La Thuile 滑雪場的 3D 地圖,該雪場跨邊境連線法國 La Rosière。資料指令碼用 Python 從 OpenStreetMap 下載雪道與纜車資料、從 AWS Terrain Tiles 獲取高程,最終打包成單個 0.8 MB 的 HTML 檔案,在手機和桌面瀏覽器中都能執行。作者還調侃說,除了建議先在黑道熱身之外,對結果相當滿意。
Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。
2026 年 10 月 3 日一篇文章指出,市面上的記憶外掛都靠 RAG:把對話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記錄被當成事實、Agent 不知道自己不知道什麼、儲存不可審計等問題。作者主張改用文件式記憶,讓 Agent 工作前查閱、工作後更新 Markdown 文件,並稱已據此做出外掛 Operator Memory,不用向量資料庫和嵌入。
開發者發布 repopedia,一個 MIT 許可的原生代碼知識圖譜工具,pip 安裝後即可在倉庫上執行,用 tree-sitter 解析並生成 SQLite 圖譜檔案,無需伺服器、Docker 或 API key,程式碼不上傳雲端。它支援查詢函式呼叫者與改動影響範圍,並可通過 MCP server 讓 Claude Code 直接查圖譜,一次拿到帶 file:line 的精確答案,而非多輪 grep。
EventMaxxer 是一個開源工具,讓 coding agent 根據你的目標、地點和日期自動發現匹配的 meetup、會議、工作坊、晚宴和駭客松,並批次申請免費活動。它把結果同步到 Google Sheets 或 CSV,按日期排序,記錄報名狀態、出席決定和備註,還支援自動恢復被限流的任務。需要 agent 有可用的已登入瀏覽器,可選本地 runner 要求 macOS/Linux 上的 Python 3.9+,Google Sheets 需要聯結器。
Docker 工程師 Dave Scott 指出,Docker Desktop 自 2016 年起就一直基於 microVM 技術執行,而非傳統 Linux 容器。2015 年起 Docker 用 Mirage Unikernel 庫建置了可嵌入的 library VMM,首版名為 hyperkit,最新版為 Docker VMM,核心與根檔案系統基於 LinuxKit 專案。
llama.cpp 合併 PR #29903,通過把 n_batch 限制在 n_ubatch 以內,修復了 server 的 laya abort 崩潰(#29902)。該修復由 Claude 輔助完成,並移除了相關測試與 embeddings 條件。
作者自建了魔獸世界私服,並做了一個可在 PC 和手機瀏覽器免費玩的客戶端 jankcraft.xyz,再用自訂 MCP 與 agent harness 通過 websocket 控制瀏覽器客戶端讓 LLM 自動遊玩,agent 頁面已上線。目前雲端訂閱使用者可能遇到問題,本地模型只要服務端開啟 CORS 即可接入;作者提供的現成模型會隨用量增長撤下。
OpenAI 發布了 GPT-6 系列的模型指南,內容涵蓋模型選擇、推理強度(reasoning effort)與工具使用。該指南面向使用 GPT-6 系列的開發者,幫助其在具體場景中決定選哪個模型、投入多少推理算力以及如何呼叫工具。原文未披露具體模型型號、引數或發布時間等細節。
一位法國傢俱廠運營總監用 Claude Code 在 30 天內做出生產管理系統,已上線供辦公室和車間每天使用。系統含 386 次提交、約 17.5 萬行 Python 與原生 JS、約 2100 個測試、約 580 個 API 路由、約 280 張 SQLite 表,技術棧為 FastAPI + SQLite + HTML/JS,跑在廠內 Windows 機器上。
開發者用 Claude 迭代了 3D 畫素風遊戲 Willowmere 的第二版,全部畫面由程式碼生成,無素材檔案、無遊戲引擎,僅用原生 HTML 和 JS,可在瀏覽器免費試玩。新版加入完整劇情三幕與結局、低潮趕海、做燈籠、月下釣魚和 Keep Watch 等玩法,並完成美術動畫與 3D 表情頭像的整體打磨。作者稱本次迭代主要用中等強度配合 Opus 5.5 完成。
llama.cpp 合併 PR #29860,新增 common_is_tty() 輔助函式並修復 Windows 上的棄用警告,作者為 Hugging Face 的 Adrien Gallouët。該提交同時更新了各平台預編譯產物,macOS Apple Silicon(arm64)正常提供,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED,openEuler 也處於 DISABLED 狀態。
llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器支援 inputs.json_schema,此前 response_format 請求不受約束。新邏輯為回應格式語法路徑優先於工具呼叫,啟用思考時要求 JSON 前有 think 塊,且 JSON 後不允許尾隨文字。該修復對應 issue #29652,由 Claude Opus 5.5 輔助完成。
llama.cpp 合併 PR #29904,通過改用融合 ADD 容差修復了 f16 精度下 ADD_ADD 測試偶發失敗的問題。該改動只涉及 CI 測試容差,不改變推理邏輯,但會隨下一次建置進入各平台發布包,包括 macOS Apple Silicon arm64、Ubuntu CUDA 12/13、Windows CUDA 12/13 等。
llama.cpp 合併 PR #29856,把 build_rs 中分散的 get_rows 合併為一次收集全部 n_rs 個 recurrent states,使預留空間按 n_rs 最大值計算,避免 ubatch 單元不連續時在節點數不變的情況下觸發圖重分配、進而在 GGML_SCHED_NO_REALLOC 下中止。
一位使用者通過在 claude.md 中寫入基本變更管理流程,解決了 Claude 擅自擴大改動、誤解指令的問題。具體做法是:每次修改前要求 Claude 先提出實施計劃、回退計劃和測試計劃,經批准後才動程式碼;提交前還要做成功驗證,報告完全成功、部分成功、失敗或需回退,只有完全成功才允許提交。
AI 使用者研究平台 Great Question(YC W21)正在加拿大遠端招聘首位產品工程師,年薪 15 萬至 18 萬加元,要求 6 年以上經驗。崗位為全棧方向,技術棧以 Rails 與 TypeScript 為主,工作內容涵蓋影片流、即時語音 agent、agentic 搜尋等,並明確要求日常使用 Claude Code、Codex、Cursor 等 agentic 編碼工具。該崗位僅限美國公民或持美國簽證者申請。
ggml-openvino 後端更新至 2026.4.1,新增 MoE 路由融合與 GDN 歸一化融合,並預設在 GPU 上啟用 MoE 融合。在 Arc B390 上跑 gemma-4-26B-A4B,配合 q4_asym64 重新量化,pp512 從 66.16 t/s 提升到 1608.73 t/s,困惑度基本不變。同時修復了 stateful 執行下 rank-3 軸處理導致的 MoE 崩潰,並改進裝置列舉與記憶體上報。
llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。
一名使用者報告其長期使用的 OpenAI API 帳戶和 Codex 20x 帳戶同時出現異常:Codex 的 60,000 積分在一次重新整理後歸零,API 帳戶則顯示為全新狀態,無發票、無呼叫記錄、無餘額。該使用者還發現組織 ID 已變更,與其歷史賬單郵件中的 ID 不一致,且其帳戶一直是個人帳戶、未建立過其他組織。目前尚無官方回應或其他使用者報告類似情況。