AISpot

模型

近期事件

  1. 1
    熱度 1.12 個來源 · 3 則10/3 12:44
  2. 2
  3. 3
    熱度 1.02 個來源 · 2 則10/3 16:36
  4. 4
    熱度 0.83 個來源 · 4 則10/3 01:56
  5. 5
    熱度 0.72 個來源 · 2 則10/2 22:25

10月3日星期六 · 3 則

  1. r/OpenAI top of the day● 精選AI 評分80

    OpenAI 發布 GPT-6 系列模型指南

    OpenAI 發布了 GPT-6 系列的模型指南,內容涵蓋模型選擇、推理強度(reasoning effort)與工具使用。該指南面向使用 GPT-6 系列的開發者,幫助其在具體場景中決定選哪個模型、投入多少推理算力以及如何呼叫工具。原文未披露具體模型型號、引數或發布時間等細節。

    推薦理由:你日常用 Codex 等 coding agent 並訂閱 ChatGPT,這份官方指南可直接用來調整模型選擇與推理強度,最佳化日常開發中的成本與效果。

  2. Latent Space● 精選AI 評分85

    GPT-6.1 Sol 發布,Sonnet 5.5 登頂 Agent Arena

    OpenAI 發布 GPT-6.1 Sol,定價 $2/$10 每百萬輸入/輸出 token,比 Astra 的 $10/$50 便宜約 80%,在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分。Sonnet 5.5 在 Agent Arena 首秀排第 3 並在 Chat 類別登頂,Anthropic 包攬前三;Sol 每任務中位成本 $0.56,比 GPT-6 Sol 便宜 39%。

    推薦理由:Sol 把前沿模型價格壓到 $2/$10,直接影響你用 Codex 與 Claude Code 的成本結構;llama.cpp 與 Ollama 的新端點則關係到你 Mac Studio 本地推理的選型。

  3. llama.cpp releases● 精選AI 評分72

    llama.cpp 新增 clef 決策模型支援(純文字)

    llama.cpp 合併 PR #29831,為 clef 決策模型加入純文字推理支援,並更新 gguf-py 常量。該版本覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台,其中 Apple Silicon 的 KleidiAI 加速建置被停用。

    推薦理由:你準備用 Mac Studio 跑本地模型,這次更新直接關係到 llama.cpp 在 Apple Silicon 上的支援範圍與建置選項。

10月2日星期五 · 6 則

  1. r/LocalLLaMA top of the day● 精選AI 評分80

    微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

    微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

    推薦理由:你可以用它的 GGUF 在 Mac Studio 上本地跑一個 4B 倉庫級編碼智慧體,但補丁必須自己審查。

  2. Ollama releases● 精選AI 評分75

    Ollama v0.35.1 接入 Cloudflare 決策模型 Clef 與 Clef Flash

    Ollama v0.35.1 新增對 Cloudflare 開源決策模型 Clef(27B)與 Clef Flash(9B)的支援,通過 /v1/systemone 呼叫。兩者支援多模態,請求可同時傳入圖片與文字 state,所有 questions 共享該狀態並聯合打分,返回如 noul 機率 0.958 的答案。

    推薦理由:你在 Mac Studio 上本地跑開源模型時,可以直接用 Ollama 試這兩個多模態決策模型,並留意 llama.cpp 與 MLX 引擎更新對 Apple Silicon 推理的影響。

  3. Hugging Face blog● 精選AI 評分65

    Ai2 開源 AstaBrief 8B 科學報告生成模型

    Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。

    推薦理由:你正打算在 Mac Studio 上跑開源模型,而 AstaBrief 就是 8B 級 Qwen 系小模型的長文生成配方,附帶的範例工作流可直接改造成本地 PDF 報告生成。

  4. Google AI blog● 精選AI 評分68

    Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

    Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。

    推薦理由:你日常靠 Claude Code、Codex、OpenCode 跑 agent,可直接在 AI Studio 或 Gemini API 上試 Gemini 3.8 Flash 的 agentic 與長週期編碼表現,而 Argon 因僅限 Fairwind 防禦者計劃,暫時和你無關…

  5. Latent Space● 精選AI 評分79

    Pi 1.0 與 Pi Durable 發布,Pi 移植到 TypeScript

    Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁,Pi 已加入 Earendil。Pi 1.0 新增 Codemode(原生支援 MCP、Jev 和影像模型)、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息、新 TUI 主題與預設全屏。Pi Durable 把 Pi 移植到 TypeScript 並外接全部有狀態元件:每步記錄為檢查點任務,程序失敗或重啟後 agent 與子 agent 自動恢復;

    推薦理由:你天天用 Claude Code、Codex、OpenCode,Pi Durable 的檢查點崩潰恢復、並行分支會話和工具熱替換正對長時 agent 任務的痛點,TypeScript 化後也更容易在本地或雲端自建執行。

  6. NVIDIA blog● 精選AI 評分86

    OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

    GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

    推薦理由:你日常用 Codex,可對照這條訊息看是否符合條件走 ChatGPT Work/Codex 入口,或直接用 API 實測更快生成對 agent 編輯—測試—除錯迴圈的實際提速。

10月1日星期四 · 4 則

  1. X @sama● 精選AI 評分78

    @sama: Also, 6.1 Sol was our fastest-growing model ever, and was a bit slow under load.

    OpenAI 的 Sam Altman 表示,6.1 Sol 是公司史上增長最快的模型,此前在高負載下回應偏慢,現在應該好很多。這條訊息只提到效能改善,沒有給出具體延遲數字、上線時間或適用方案範圍。

    推薦理由:你訂閱了 ChatGPT 並用 Codex 做 coding agent,若 6.1 Sol 已進入你的使用路徑,這次負載最佳化可能直接改善高峰時段的回應速度。

  2. Cloudflare blog (AI)● 精選AI 評分66

    Cloudflare 開源決策模型 Clef 與 Clef-flash,並推出 RL 微調平台

    Cloudflare 在 Workers AI 上發布自研決策模型 Clef 與 Clef-flash,並以 Apache 2.0 許可在 Hugging Face 完全開源、可本地執行,同時推出可把 Clef 微調到自家場景的強化學習產品。

    推薦理由:Apache 2.0 開源意味著你可以把這兩個小模型拉到 Mac Studio 本地跑,用它替掉 agent 裡高頻的路由與分類判斷,換來遠低於 LLM 的延遲和確定性結構化輸出。

  3. 量子位● 精選AI 評分80

    Google 突然發布 Gemini 4 Argon,多項榜單登頂

    Google 於 2026 年 10 月 1 日發布 Gemini 4 Argon,在 DeepSWE v1.1 長期軟體工程任務得 77.9%,高於 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,並以 68.90% 登頂 Vals Index。定價為每百萬輸入 Token 2 美元、輸出 Token 10 美元,優惠期單題成本比 Astra 低約四成,輸出上限達百萬 Token。

    推薦理由:作為同時用 Claude Code、Codex 等 coding agent 的付費使用者,可以記下 Argon 的百萬 Token 長任務能力和更低單價,但它現階段只面向稽核過的安全團隊,短期內還用不上。

  4. Latent Space● 精選AI 評分84

    Gemini 4 Argon 發布,輸出上限 100 萬 token,僅限安全預覽

    Google DeepMind 發布 Gemini 4 Argon,首次支援最高 100 萬 token 輸出,但目前僅在 Fairwind 計劃下對政府使用者與受信任網路安全人員開放預覽,開發者、企業與消費者開放時間未定。標準價 $4/$20 每百萬輸入/輸出 token,首推五折 $2/$10,快取輸入 95% 折扣;19 項公開基準中拿下 13 項第一。100 萬輸出靠新 API 功能 Long Decode Continuation 實現,長回覆會暫停並跨呼叫續寫;

    推薦理由:Argon 現階段只對政府與安全人員開放,你還用不上,但每任務 $1.99 的折扣成本、$2/$10 定價和 15% 幻覺率(Astra 51%)可作為比較 Claude Code、Codex 背後模型價效比的參照。

9月30日星期三 · 1 則

  1. Latent Space● 精選AI 評分81

    OpenAI DevDay 發布 GPT-6.1 Sol、Dots 與 Agents API

    OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。

    推薦理由:GPT-6.1 Sol 的 Computer Use 成本與新 Agents API 的非同步呼叫、快取預熱、compaction 機制,直接影響你用 Codex 等 coding agent 時的延遲與賬單。