AISpot

新聞報導

近期事件

  1. 1
  2. 2
    熱度 1.54 個來源 · 4 則10/3 00:03
  3. 3
    熱度 1.54 個來源 · 4 則10/2 23:40
  4. 4
    熱度 1.23 個來源 · 3 則10/3 01:45
  5. 5

10月3日星期六 · 2 則

  1. Latent Space● 精選AI 評分85

    GPT-6.1 Sol 發布,Sonnet 5.5 登頂 Agent Arena

    OpenAI 發布 GPT-6.1 Sol,定價 $2/$10 每百萬輸入/輸出 token,比 Astra 的 $10/$50 便宜約 80%,在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分。Sonnet 5.5 在 Agent Arena 首秀排第 3 並在 Chat 類別登頂,Anthropic 包攬前三;Sol 每任務中位成本 $0.56,比 GPT-6 Sol 便宜 39%。

    推薦理由:Sol 把前沿模型價格壓到 $2/$10,直接影響你用 Codex 與 Claude Code 的成本結構;llama.cpp 與 Ollama 的新端點則關係到你 Mac Studio 本地推理的選型。

  2. Ars Technica AI● 精選AI 評分78

    蘋果收緊 macOS 完整磁碟取用權限,防 AI agent 濫用

    蘋果宣布調整 macOS 隱私設定,阻止第三方應用開發者濫用權限讀取資訊記錄。此前有專欄作家稱 Meta 的通用 AI agent Muse 未經授權就推送了涉及他與同事 Apple Messages 對話的通知,引發大量使用者共鳴。Meta CTO 回應稱,Muse 要讀取 Apple Messages 需使用者手動授予完整磁碟取用權限並在 Muse 中開啟 Messages 聯結器。

    推薦理由:你在 Mac 上跑本地模型和 coding agent,完整磁碟取用權限正是 Ollama、LM Studio 這類工具常被要求授予的權限,這次改動會直接影響你給本地 AI 工具放權的邊界。

10月2日星期五 · 2 則

  1. The Verge AI● 精選AI 評分80

    Apple 將限制 Mac 完整磁碟取用權限,應對 AI 代理風險

    Apple 於週五宣布將在 Mac 上對「完整磁碟取用」(full disk access)增加新的限制與控制,要求真正想授予應用這一級別權限的使用者「必須通過非常明確的動作」才能完成授權,理由是 AI 代理帶來的風險大幅上升。此事發生前幾週,Inc 的 Jason Aten 發現 Meta 的 Muse AI 在未獲明確授權的情況下知道了他訊息的內容;Meta 發言人 Andy Stone 回應稱訊息訪問完全基於使用者主動選擇加入。

    推薦理由:你日常跑 Claude Code、Codex、OpenCode,這類代理一旦拿到完整磁碟取用就能讀到專案目錄之外的程式碼與憑據,這項改動會直接影響你今後給它們授權的方式。

  2. Latent Space● 精選AI 評分79

    Pi 1.0 與 Pi Durable 發布,Pi 移植到 TypeScript

    Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁,Pi 已加入 Earendil。Pi 1.0 新增 Codemode(原生支援 MCP、Jev 和影像模型)、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息、新 TUI 主題與預設全屏。Pi Durable 把 Pi 移植到 TypeScript 並外接全部有狀態元件:每步記錄為檢查點任務,程序失敗或重啟後 agent 與子 agent 自動恢復;

    推薦理由:你天天用 Claude Code、Codex、OpenCode,Pi Durable 的檢查點崩潰恢復、並行分支會話和工具熱替換正對長時 agent 任務的痛點,TypeScript 化後也更容易在本地或雲端自建執行。

10月1日星期四 · 3 則

  1. 量子位● 精選AI 評分66

    何愷明團隊 NAT-ARC:純視覺解 ARC,整合達 70.2%

    何愷明團隊提出純視覺 ARC 解題方案 NAT-ARC,不用 LLM,單模型(huge,0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合三種預訓練策略後達 70.2%,總引數約 2B。做法是先用 ImageNet(約 130 萬張自然影像)上訓練的 MAE encoder 權重初始化編碼器,再在 ARC 訓練集離線訓練,測試時對每道題單獨 LoRA 微調;

    推薦理由:對你評估本地小模型很有參考價值:0.6B 單模型與約 2B 整合,靠公開 MAE 權重預訓練就能逼近 8B LLM 方案,說明小引數模型也能承擔視覺推理任務。

  2. 量子位● 精選AI 評分80

    Google 突然發布 Gemini 4 Argon,多項榜單登頂

    Google 於 2026 年 10 月 1 日發布 Gemini 4 Argon,在 DeepSWE v1.1 長期軟體工程任務得 77.9%,高於 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,並以 68.90% 登頂 Vals Index。定價為每百萬輸入 Token 2 美元、輸出 Token 10 美元,優惠期單題成本比 Astra 低約四成,輸出上限達百萬 Token。

    推薦理由:作為同時用 Claude Code、Codex 等 coding agent 的付費使用者,可以記下 Argon 的百萬 Token 長任務能力和更低單價,但它現階段只面向稽核過的安全團隊,短期內還用不上。

  3. Latent Space● 精選AI 評分84

    Gemini 4 Argon 發布,輸出上限 100 萬 token,僅限安全預覽

    Google DeepMind 發布 Gemini 4 Argon,首次支援最高 100 萬 token 輸出,但目前僅在 Fairwind 計劃下對政府使用者與受信任網路安全人員開放預覽,開發者、企業與消費者開放時間未定。標準價 $4/$20 每百萬輸入/輸出 token,首推五折 $2/$10,快取輸入 95% 折扣;19 項公開基準中拿下 13 項第一。100 萬輸出靠新 API 功能 Long Decode Continuation 實現,長回覆會暫停並跨呼叫續寫;

    推薦理由:Argon 現階段只對政府與安全人員開放,你還用不上,但每任務 $1.99 的折扣成本、$2/$10 定價和 15% 幻覺率(Astra 51%)可作為比較 Claude Code、Codex 背後模型價效比的參照。