微軟發布 FrogNano-4B,面向低視訊記憶體裝置的編碼 agent
微軟推出 FrogNano-4B,基於 Qwen3.5-4B 做後訓練,專注倉庫級軟體工程。它用強化學習在約 1500 個合成 SWE 任務環境中訓練,配合五工具 Leaf harness。訓練資料偏 Python 和英文,生成的 patch 需人工審查與測試。
這是 4B 小模型且有 GGUF 版本,可放進你在 Mac Studio 上用 llama.cpp、Ollama 本地跑編碼 agent 的方案裡做低成本嘗試。
過去 7 天,兩次評分都夠高才會入選。最後更新 10/2 22:50。
微軟推出 FrogNano-4B,基於 Qwen3.5-4B 做後訓練,專注倉庫級軟體工程。它用強化學習在約 1500 個合成 SWE 任務環境中訓練,配合五工具 Leaf harness。訓練資料偏 Python 和英文,生成的 patch 需人工審查與測試。
這是 4B 小模型且有 GGUF 版本,可放進你在 Mac Studio 上用 llama.cpp、Ollama 本地跑編碼 agent 的方案裡做低成本嘗試。
Apple 將在 Mac 上為"完全磁碟訪問"權限增加新的限制,原因是 AI agent 帶來的風險上升。新控制元件要求只有使用者做出非常明確的動作,才能把這一"特殊級別"的訪問權授予某個應用。此前 Inc 的 Jason Aten 發現,Meta 的 Muse AI 在他未明確授權的情況下知道了他資訊的內容。
你常用 coding agent 操作本地檔案,之後給 Claude Code、Codex 這類工具授予全盤訪問會更麻煩,需要提前規劃要開放的目錄與權限範圍。
Ai2 開源 AstaBrief 8B,一個把研究問題與檢索到的文獻片段轉成帶引用報告的小模型,基座是 Qwen3-8B。在 Asta 的 Fast mode 中它平均 51.1 秒生成一篇報告,Claude 驅動的 Thinking mode 為 178.5 秒,約快 3.5 倍。模型權重、訓練資料與示例工作流均已開放。
可下載權重意味著能在自有基礎設施上本地跑報告生成,正對應你在 Mac Studio 上跑開源模型的計劃,也便於用 51.1 秒對 178.5 秒的資料權衡小模型與 Claude 的速度成本取捨。
llama.cpp 構建 b11345 為 Hexagon NPU 後端新增 q2_k 和 q3_k 量化型別支援(#29717),並統一了 src1_row_size 的分配。該版本產物覆蓋 macOS Apple Silicon、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 版本為 DISABLED。
Hexagon 是高通 NPU 後端,這條改動讓 Snapdragon 裝置(Android、Windows arm64)能用上 q2_k/q3_k 低位元量化,而你的 Mac Studio + Apple Silicon 推理路徑不在這次改動範圍內;
NVIDIA DGX Spark 64GB 統一記憶體版 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,單機支援最高 1000 億引數模型本地執行。兩臺經 ConnectX-7 組叢集后記憶體擴至 128GB、可跑 2000 億引數,官方 Qwen 3.8 27B 測試效能最高 1.7 倍。
你正打算買 Mac Studio 本地跑開源模型,這條給了一個 4999 美元、64GB 統一記憶體的對照方案,且開箱即支援你在用的 Ollama、llama.cpp、LM Studio,NVIDIA Sync 還能自動把 OpenCode 接到本地模型。
GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放。它執行在 NVIDIA Blackwell GPU 上,token 生成速度最高是 Astra Standard 模式的 8 倍,可縮短 coding agent 的 edit-test-debug 迴圈。
你日常用 Codex 等 coding agent,這個更快模式可直接減少工具呼叫之間的等待,且能通過 API 接入自己的流程。
Cloudflare 發布兩個自訓決策模型 Clef 和 Clef-flash,託管在 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,同時推出新的 RL 微調平台。Clef 在 Jev Decision Index 上目前排名第一,中位延遲 209.3ms,低於 Jev 的 524.1ms。它帶視覺編碼器、64k 上下文,可返回帶機率的結構化分類結果。
你可以拿到 Apache 2.0 權重在本地直接跑這類小模型做分類與路由,不必消耗大模型推理資源,也適合塞進 agent 的關鍵路徑上做快速決策。
何愷明團隊提出 NAT-ARC,用 ImageNet 上 MAE 預訓練的 encoder 做純視覺 ARC 解法,不依賴 LLM。單模型 0.6B 引數在 ARC-1 拿到 63.4% pass@2,整合約 2B 引數達 70.2%。論文稱預訓練打通了視覺路線的 scaling 瓶頸。
0.6B 小模型靠公開 MAE 權重預訓練就逼近 8B 專用 LLM,且無預訓練時模型越大反而掉點——你本地跑開源模型時,可優先看預訓練權重而非堆引數。
Google 發布 Gemini 4 Argon,在 DeepSWE v1.1 得 77.9%,高於 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1%。每百萬輸入 2 美元、輸出 10 美元,優惠期單題成本比 Astra 低約四成,最高支援百萬 Token 輸出。目前僅開放給經過稽核的網路安全團隊。
可當作 Claude Code、Codex 未來換用模型的參考:價效比和長任務輸出上限都是賣點,但眼下還訂不到、用不上。
Google DeepMind 發布 Gemini 4 Argon,但僅限政府使用者與 Fairwind 計劃網路安全人員預覽。它通過 Long Decode Continuation 把輸出上限做到行業首個 1M token,此前為 64K。定價 $4/$20 每百萬 token,五折後 $2/$10,快取輸入再降 95%。
雖然暫不對開發者開放,但 $2/$10 的折扣價、1M 輸出與 62K 輸出 token/任務的成本結構,值得先在 Claude Code、Codex 的選型與成本對比裡記一筆。