AISpot

AI 熱點精選

過去 7 天,兩次評分都夠高才會入選。最後更新 10/2 22:50。

2026年10月2日週五

微軟發布 FrogNano-4B,面向低視訊記憶體裝置的編碼 agent

80r/LocalLLaMA top of the day10/2 21:16模型開源

微軟推出 FrogNano-4B,基於 Qwen3.5-4B 做後訓練,專注倉庫級軟體工程。它用強化學習在約 1500 個合成 SWE 任務環境中訓練,配合五工具 Leaf harness。訓練資料偏 Python 和英文,生成的 patch 需人工審查與測試。

這是 4B 小模型且有 GGUF 版本,可放進你在 Mac Studio 上用 llama.cpp、Ollama 本地跑編碼 agent 的方案裡做低成本嘗試。

Apple 將限制 Mac 全盤訪問權限,以應對 AI agent 風險

80The Verge AI10/2 21:08政策與安全產品與方案

Apple 將在 Mac 上為"完全磁碟訪問"權限增加新的限制,原因是 AI agent 帶來的風險上升。新控制元件要求只有使用者做出非常明確的動作,才能把這一"特殊級別"的訪問權授予某個應用。此前 Inc 的 Jason Aten 發現,Meta 的 Muse AI 在他未明確授權的情況下知道了他資訊的內容。

你常用 coding agent 操作本地檔案,之後給 Claude Code、Codex 這類工具授予全盤訪問會更麻煩,需要提前規劃要開放的目錄與權限範圍。

Ai2 開源 8B 科學報告生成模型 AstaBrief

65Hugging Face blog10/2 16:19模型產品與方案

Ai2 開源 AstaBrief 8B,一個把研究問題與檢索到的文獻片段轉成帶引用報告的小模型,基座是 Qwen3-8B。在 Asta 的 Fast mode 中它平均 51.1 秒生成一篇報告,Claude 驅動的 Thinking mode 為 178.5 秒,約快 3.5 倍。模型權重、訓練資料與示例工作流均已開放。

可下載權重意味著能在自有基礎設施上本地跑報告生成,正對應你在 Mac Studio 上跑開源模型的計劃,也便於用 51.1 秒對 178.5 秒的資料權衡小模型與 Claude 的速度成本取捨。

llama.cpp 為 Hexagon 後端加入 q2_k 與 q3_k 量化支援

60llama.cpp releases10/2 14:11地端推論開源

llama.cpp 構建 b11345 為 Hexagon NPU 後端新增 q2_k 和 q3_k 量化型別支援(#29717),並統一了 src1_row_size 的分配。該版本產物覆蓋 macOS Apple Silicon、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 版本為 DISABLED。

Hexagon 是高通 NPU 後端,這條改動讓 Snapdragon 裝置(Android、Windows arm64)能用上 q2_k/q3_k 低位元量化,而你的 Mac Studio + Apple Silicon 推理路徑不在這次改動範圍內;

原標題:b11345

NVIDIA DGX Spark 新增 64GB 版,10 月 23 日上市售 4999 美元

72NVIDIA blog10/2 14:00地端推論產品與方案

NVIDIA DGX Spark 64GB 統一記憶體版 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,單機支援最高 1000 億引數模型本地執行。兩臺經 ConnectX-7 組叢集后記憶體擴至 128GB、可跑 2000 億引數,官方 Qwen 3.8 27B 測試效能最高 1.7 倍。

你正打算買 Mac Studio 本地跑開源模型,這條給了一個 4999 美元、64GB 統一記憶體的對照方案,且開箱即支援你在用的 Ollama、llama.cpp、LM Studio,NVIDIA Sync 還能自動把 OpenCode 接到本地模型。

GPT-6 Astra Ultrafast 上線,token 生成最高快 8 倍

86NVIDIA blog10/2 00:44模型產品與方案

GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放。它執行在 NVIDIA Blackwell GPU 上,token 生成速度最高是 Astra Standard 模式的 8 倍,可縮短 coding agent 的 edit-test-debug 迴圈。

你日常用 Codex 等 coding agent,這個更快模式可直接減少工具呼叫之間的等待,且能通過 API 接入自己的流程。

2026年10月1日週四

Cloudflare 開源決策模型 Clef 與 Clef-flash

66Cloudflare blog (AI)10/1 16:34模型開源

Cloudflare 發布兩個自訓決策模型 Clef 和 Clef-flash,託管在 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,同時推出新的 RL 微調平台。Clef 在 Jev Decision Index 上目前排名第一,中位延遲 209.3ms,低於 Jev 的 524.1ms。它帶視覺編碼器、64k 上下文,可返回帶機率的結構化分類結果。

你可以拿到 Apache 2.0 權重在本地直接跑這類小模型做分類與路由,不必消耗大模型推理資源,也適合塞進 agent 的關鍵路徑上做快速決策。

何愷明團隊提出 NAT-ARC,純視覺方案解 ARC 達 70.2%

66量子位10/1 16:06研究

何愷明團隊提出 NAT-ARC,用 ImageNet 上 MAE 預訓練的 encoder 做純視覺 ARC 解法,不依賴 LLM。單模型 0.6B 引數在 ARC-1 拿到 63.4% pass@2,整合約 2B 引數達 70.2%。論文稱預訓練打通了視覺路線的 scaling 瓶頸。

0.6B 小模型靠公開 MAE 權重預訓練就逼近 8B 專用 LLM,且無預訓練時模型越大反而掉點——你本地跑開源模型時,可優先看預訓練權重而非堆引數。

Google Gemini 4 Argon 發布,多榜單登頂,價格約 Astra 一半

80量子位10/1 16:02模型產品與方案

Google 發布 Gemini 4 Argon,在 DeepSWE v1.1 得 77.9%,高於 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1%。每百萬輸入 2 美元、輸出 10 美元,優惠期單題成本比 Astra 低約四成,最高支援百萬 Token 輸出。目前僅開放給經過稽核的網路安全團隊。

可當作 Claude Code、Codex 未來換用模型的參考:價效比和長任務輸出上限都是賣點,但眼下還訂不到、用不上。

Google 發布 Gemini 4 Argon,19 項基準中 13 項第一

84Latent Space10/1 07:45模型產品與方案

Google DeepMind 發布 Gemini 4 Argon,但僅限政府使用者與 Fairwind 計劃網路安全人員預覽。它通過 Long Decode Continuation 把輸出上限做到行業首個 1M token,此前為 64K。定價 $4/$20 每百萬 token,五折後 $2/$10,快取輸入再降 95%。

雖然暫不對開發者開放,但 $2/$10 的折扣價、1M 輸出與 62K 輸出 token/任務的成本結構,值得先在 Claude Code、Codex 的選型與成本對比裡記一筆。