AISpot

Coding Agent 與開發工具

10月2日星期五 · 31 則

  1. Kimi blog● 精選AI 評分82

    Kimi K3 發布:2.8T 引數開放模型,支援 100 萬 token 上下文

    Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;

  2. DeepSeek news● 精選AI 評分87

    DeepSeek 發布 V4.1-Flash:552B MoE,KV 快取降至上代 1/4

    DeepSeek 發布 V4.1-Flash:552B MoE、原生多模態,已上線 DeepSeek API(模型名 deepseek-flash),舊版 V4-Flash 與 V4-Flash-Vision-Exp 退役。新因果編碼器–解碼器架構只有 8B 輸入、16B 輸出啟用引數,KV 快取降至上一代的 1/4 HBM 與 1/8 SSD,官方稱多方測試顯示其在效能、成本、速度和總執行時間上超過 V4-Pro,V4-Pro 將逐步淘汰。

  3. Hacker News front pageAI 評分47

    每個 SaaS 業務都將變成圍繞模型的 harness

    作者 Shrivu Shankar 認為,每個 SaaS 業務最終都會變成圍繞無狀態 LLM 的 harness,也就是模型之外的基礎設施、介面、上下文與狀態。他給出四階段路徑:無 harness、個人操作 harness、個人編排 harness,最後是 harness 編排個人,核心任務交給雲端後臺 agent,人類只在關鍵處提供品味與判斷。Claude Code、Codex、OpenCode、LangGraph 被他列為狹義 harness 的例子;

  4. Claude Code releases● 精選AI 評分84

    Claude Code 2.1.288 修復恢復會話丟失上下文與超時中斷問題

    Claude Code 發布 v2.1.288。修復了長對話報「Prompt is too long」卻不自動壓縮、--resume 丟失剛被壓縮恢復的檔案與上下文、恢復的會話不儲存該輪最後回覆,以及回應中途 API 超時導致整輪失敗——非互動會話與子代理現在會從部分回應繼續,僅有思考內容的回應會重試。

  5. r/LocalLLaMA top of the day● 精選AI 評分80

    微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

    微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

  6. Hacker News front pageAI 評分42

    開源工具用 GPT-6 Astra 與 Opus 5.5 生成 LDraw 樂高模型

    一位開發者發布了開源樂高 AI 生成器:一套 Python 工具、指令與文件,讓 AI agent 直接生成 LDraw 語言的樂高 CAD 模型。作者從去年 12 月開始試驗用 ChatGPT 和 Claude 寫 LDraw 程式碼,最終用 GPT-6 Astra 和 Opus 5.5 跑通,並打包成 Docker 化 Web 應用,可選 OpenAI、Claude、OpenRouter 三類提供方。

  7. Hacker News front pageAI 評分44

    Pi pod 發布:在自有伺服器沙箱中執行 pi coding agent

    Pi pod 是一個圍繞 pi coding agent 建置的自託管沙箱環境,可讓你在自己的伺服器上以隔離沙箱方式執行 pi,並補充了 agent 沙箱、原生客戶端、RBAC 會話共享和介面自動化等能力。自託管版現已提供倉庫可直接部署,託管服務尚未上線,官方計劃 v1 提供需綁卡的 7 天 Standard 試用(10 個活躍小時,之後 20 美元/月)或 50 美元/月的 Pro 方案。

  8. r/ClaudeAI top of the dayAI 評分50

    Claude Code 外掛 Claude Fables 把工具呼叫演成動畫

    免費開源的 Claude Code 桌面版外掛 Claude Fables 已發布在 GitHub,Claude 工作時它會觀察每次工具呼叫和每行輸出,每隔幾秒在輸入框上方用一段短動畫複述最新進展。Claude 是個橙色小生物,有 20 種動作、7 個場景和 11 種視覺風格,用 /fables style 切換;安裝只需把倉庫路徑寫進 ~/.claude/settings.json 的 CLAUDE_CODE_PLUGIN_DIRS 再重啟應用。

  9. llama.cpp releasesAI 評分50

    llama.cpp 為 ggml 緩衝區介面新增 alloc_buffer_n 與 get_alloc_size_n

    llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 與 get_alloc_size_n 方法,並公開 ggml_backend_buft_alloc_buffer_n、ggml_backend_buft_get_alloc_size_n 兩個 API。預設實現負責多緩衝區分割與張量分配,Meta buffer type 提供自訂實現,按裝置建立子上下文並委託給 simple buffer type;

  10. r/ClaudeAI top of the dayAI 評分35

    團隊引入 Claude 後,衝刺幾天完成,管理層發愁找活

    一位負責企業系統開發的團隊負責人稱,團隊最近開始使用 Claude,原本按周計的衝刺現在幾天就能清空。其技術棧以 Python/TypeScript 為主,涉及大規模資料處理、DevOps 與微服務。團隊因此沒活可幹,產品管理部門難以找到更多工,他本人大部分時間花在規劃會議上,並在帖子中徵求對後續走向的猜測。

  11. r/ClaudeAI top of the dayAI 評分42

    DensePack 把文字打包成圖片,Claude Code 省一半 token

    DensePack 是一個 Claude Code 外掛,把 Read 讀取的文字、Bash 輸出、Word 檔案和子代理報告打包成圖片交給 agent 閱讀,按作者基準測試可省約 50% 的 token 費用,且後續快取讀取也按這個折扣計價。它用顏色編碼和兩行圖例,聲稱能從圖片逐位元組還原始碼檔案,並保留文字副本作為回退。專案發布兩週、獲 8 個 star,已通過 Anthropic 外掛提交的初期階段,最新版本 1.3.3,1.4 將支援與其他外掛共用。

  12. r/ClaudeAI top of the dayAI 評分30

    Opus 5.5 與 Sol 6.1 15 分鐘用 three.js 建布萊德湖城堡

    一位使用者用 15 分鐘限時提示,讓 Opus 5.5 和 Sol 6.1 分別用 three.js 建置可旋轉視角的簡化版布萊德湖城堡。Opus 5.5 用時 5 分 46 秒,約 300k 輸入加 18k 輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 400k 輸入加 16k 輸出 token,估算約 0.96 美元。Opus 5.5 產出約 27 KB、520 行、3 個 CDN 指令碼;

  13. r/ClaudeAI top of the dayAI 評分30

    Opus 5.5 一次生成 19 美元瑞安航空航班逐幀動畫

    Reddit r/ClaudeAI 使用者 Efistoffeles 只給 Opus 5.5 一句提示詞,要求它用 JavaScript 逐幀畫出自己對一張 19 美元瑞安航空機票的看法,模型一次生成成功,耗時約 8 分鐘,程式碼以 Claude artifact 形式公開、可直接執行。評論區認為這段動畫像真實的瑞安航空降落,甚至有人誤以為飛機墜毀,作者回應“技術上算降落了”。他還在評論中表示,19 美元機票在歐盟相當常見。

  14. Google AI blog● 精選AI 評分68

    Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

    Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。

  15. Latent SpaceAI 評分51

    Airbnb 稱 60% 程式碼由 AI 編寫,靠內部工具 Everest 加速開發

    Airbnb CTO Ahmad Al-Dahle(前 Meta 生成式 AI 負責人、Llama 系列發布負責人)披露,Airbnb 目前約 60% 的程式碼由 AI 編寫,功能交付量同比增加近 80%,工程師的 PR 吞吐量提升約 1.6 倍。約一半客服工單已由 AI 獨立解決(Q2 財報為近 45%),但安全類問題仍轉人工,上線前用合成資料做測試。

  16. Cloudflare blog (AI)● 精選AI 評分65

    Cloudflare 在 AI Gateway 推出 Web Search API

    Cloudflare 宣布與 Ceramic.ai、Exa、Linkup 三家搜尋服務商合作,在 AI Gateway 上推出 Web Search API,讓 agent 先搜尋再作答,而不是猜 URL 後 curl 出 404。開發者可通過標準 REST 介面呼叫,或在 Workers 裡用一行程式碼繫結,未來還將作為內建 Server Tools 提供。

  17. NVIDIA blog● 精選AI 評分72

    NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

    NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

  18. Cloudflare blog (AI)AI 評分38

    Cloudflare 向 30 家非營利組織發放 750 萬美元 AI 額度

    Cloudflare 公布首批非營利創業扶持計劃的 30 家入選組織,共獲得超過 750 萬美元開發者服務額度,每家最高 25 萬美元。這些組織用 Workers AI、AI Gateway 等建置自動化工具:LebTown 用自建編輯管理系統替代 Google Docs,Kaya Guides 的 WhatsApp 心理健康應用截至 2026 年 9 月已服務 10,439 人、每月處理約 50 萬條訊息。

  19. 量子位AI 評分52

    openJiuwen 首發 X-Router 自演進模型路由,實測省 50%+ Token

    openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。

  20. Latent Space● 精選AI 評分79

    Pi 1.0 與 Pi Durable 發布,Pi 移植到 TypeScript

    Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁,Pi 已加入 Earendil。Pi 1.0 新增 Codemode(原生支援 MCP、Jev 和影像模型)、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息、新 TUI 主題與預設全屏。Pi Durable 把 Pi 移植到 TypeScript 並外接全部有狀態元件:每步記錄為檢查點任務,程序失敗或重啟後 agent 與子 agent 自動恢復;

  21. X @karpathyAI 評分50

    Karpathy 建議用圖表、網頁和影片理解 LLM 輸出

    Karpathy 認為,隨著 LLM 能力提升,人的工作會更多轉向監督與理解模型輸出,而 LLM 本身也能幫忙。他推薦幾個技巧:讓模型用 ASD-STE100 受控語言寫作,或要求輸出 HTML 網頁、圖表,甚至定製講解影片,例如用 ElevenLabs API key 生成 3b1b 風格影片。這些大型、一次性軟體產物以前不值得做,現在可以按需生成。

  22. Latent Space● 精選AI 評分67

    Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

    Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

  23. NVIDIA blog● 精選AI 評分86

    OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

    GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

10月1日星期四 · 6 則

  1. Claude Code releases● 精選AI 評分78

    Claude Code v2.1.287 新增 Claude Mods 與 You should know 外掛

    Claude Code 發布 v2.1.287:新增 Claude Mods,外掛可以修改更深層行為;並內建 You should know,由側邊 agent 監視你或 Claude 可能遺漏的內容,用 /plugin enable cc-plugin-you-should-know@builtin 開啟(需第一方會話且開啟遙測)。agents 檢視新增 n:<text> 過濾器匹配會話名與任務;

  2. Cloudflare blog (AI)AI 評分45

    Cloudflare OS 開放全託管等待名單,新增 GitHub 倉庫與 Google Workspace 支援

    Cloudflare OS 開放全託管部署的等待名單:企業只需在 Cloudflare 控制台指定自訂域名、Access 策略與 AI Gateway,其餘配置與運維由 Cloudflare 負責。該產品上月開源,已有數千家組織用它處理公司資料、生成文件幻燈片和自動化任務。

  3. Anthropic NewsAI 評分45

    巴克萊銀行擴大與 Anthropic 合作,2026 年底 Claude Code 覆蓋半數開發者

    巴克萊銀行宣布擴大與 Anthropic 的戰略合作,在全行範圍部署 Claude,目標是 2026 年底 Claude Code 覆蓋其 50% 的開發者,2027 年覆蓋多數軟體工程師。已落地的應用包括:基於 RAG 的 Colleague Knowledge Assistant 自 2025 年上線,已有超 1.6 萬名員工使用、處理超 100 萬次搜尋;全球市場業務用 Claude 每天處理約 12 萬封客戶郵件,進行分類、資訊補全和路由判斷。

  4. Anthropic Research● 精選AI 評分68

    物理學家用 Claude 打造 BootLoops 科研工具

    理論物理學家 Matthew Schwartz 發布開源工具 BootLoops,把 Claude 當作 LLM 的"挽具",專攻適合當前 AI 的"Claude 形狀"問題。他用 Claude Fable 5 移植並改進散射振幅計算方法,還借 BootLoops 把數學物理技術帶到生態學、群體遺傳學、地質、經濟、語言學等領域,並與各領域專家合作篩選真正有價值的問題。BootLoops 開源,可搭配任意模型使用,但當前 AI 仍無法解決科學中的大多數問題。

9月30日星期三 · 3 則

  1. OpenCode releases● 精選AI 評分75

    OpenCode v1.18.34 修復 macOS 27+ 本地編譯執行問題

    OpenCode 發布 v1.18.34,修復本地編譯的 macOS 二進位制在 macOS 27+ 上無法可靠執行的問題,改為編譯後重新簽名,並用 Developer ID 簽名 macOS CLI 發布版。同時模型請求現在會傳送帶名稱空間的會話與父會話身份頭,TUI 的 /status 對話方塊改用 path.sep 提取外掛名,網頁文件修正了 GPT 6.1 Sol 的快取定價。

  2. Latent Space● 精選AI 評分81

    OpenAI DevDay 發布 GPT-6.1 Sol、Dots 與 Agents API

    OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。

更早的內容