AISpot

模型

10月2日星期五 · 8 則

  1. r/ClaudeAI top of the dayAI 評分23

    Reddit 使用者用同一提示詞對比 Sonnet 5.5 與 Opus 5.5 動效

    r/ClaudeAI 使用者 CFNStudio 給 Sonnet 5.5 和 Opus 5.5 同一個提示詞「為自己的模型做一支發布影片,告訴人們為什麼該用它」,並放出兩支成片供對比。評論裡有人指出提示詞太籠統,無法做嚴謹的橫向比較;有人追問底層用的是 Remotion 還是 FFmpeg,帖中未回答。一位自稱給客戶做動畫的從業者說這兩支動畫客觀上很差、目前只能靠改提示詞來編輯,不可交付;也有人回帖稱這種一次成型的進步很快,並且可以用 Remotion 之類的工具再編輯。

  2. r/ClaudeAI top of the dayAI 評分41

    r/ClaudeAI 熱議 Opus 5.5 被削弱

    Reddit 的 r/ClaudeAI 版塊出現熱帖,多數評論者認為 Opus 5.5 已被削弱(發帖人把 nerfed 誤寫成 nerded)。主流猜測是官方先用新模型拉訂閱、隨後降低算力省成本,同時讓下一代模型顯得更強;少數使用者稱模型仍正常甚至仍是最好的模型,品質下滑感來自上下文堆積、未新開對話。有人貼出 nerf 追蹤基準顯示輕微下滑,但被指仍在正常誤差範圍內;也有評論指出 Opus 5.5 發布當天就會說 load-bearing,不能當作降級訊號。

  3. Hugging Face blog● 精選AI 評分65

    Ai2 開源 AstaBrief 8B 科學報告生成模型

    Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。

  4. Google AI blog● 精選AI 評分68

    Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

    Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。

  5. Latent Space● 精選AI 評分79

    Pi 1.0 與 Pi Durable 發布,Pi 移植到 TypeScript

    Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁,Pi 已加入 Earendil。Pi 1.0 新增 Codemode(原生支援 MCP、Jev 和影像模型)、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息、新 TUI 主題與預設全屏。Pi Durable 把 Pi 移植到 TypeScript 並外接全部有狀態元件:每步記錄為檢查點任務,程序失敗或重啟後 agent 與子 agent 自動恢復;

  6. Hugging Face blogAI 評分46

    ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

    ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。

  7. NVIDIA blog● 精選AI 評分86

    OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

    GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

10月1日星期四 · 5 則

  1. 量子位● 精選AI 評分80

    Google 突然發布 Gemini 4 Argon,多項榜單登頂

    Google 於 2026 年 10 月 1 日發布 Gemini 4 Argon,在 DeepSWE v1.1 長期軟體工程任務得 77.9%,高於 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,並以 68.90% 登頂 Vals Index。定價為每百萬輸入 Token 2 美元、輸出 Token 10 美元,優惠期單題成本比 Astra 低約四成,輸出上限達百萬 Token。

  2. Cloudflare blog (AI)AI 評分63

    Workers AI 上線 EuroLLM 與 Apertus 兩款歐洲開源模型

    Cloudflare 在 Workers AI 上線兩款由歐洲公共機構訓練的開源模型:覆蓋全部 24 種歐盟官方語言的 EuroLLM,以及瑞士 ETH Zurich、EPFL 等打造的 Apertus,今天即可申請訪問。Apertus 用逾 15 萬億 token、1500 多種語言訓練,40% 訓練資料非英語,架構、權重、資料與方法全部公開,並按 EU AI Act 與 GDPR 處理訓練退出與個人資料。

  3. Latent Space● 精選AI 評分84

    Gemini 4 Argon 發布,輸出上限 100 萬 token,僅限安全預覽

    Google DeepMind 發布 Gemini 4 Argon,首次支援最高 100 萬 token 輸出,但目前僅在 Fairwind 計劃下對政府使用者與受信任網路安全人員開放預覽,開發者、企業與消費者開放時間未定。標準價 $4/$20 每百萬輸入/輸出 token,首推五折 $2/$10,快取輸入 95% 折扣;19 項公開基準中拿下 13 項第一。100 萬輸出靠新 API 功能 Long Decode Continuation 實現,長回覆會暫停並跨呼叫續寫;

9月30日星期三 · 4 則

  1. Latent Space● 精選AI 評分81

    OpenAI DevDay 發布 GPT-6.1 Sol、Dots 與 Agents API

    OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。

  2. Google DeepMind blog● 精選AI 評分83

    Google 發布 Gemini 4 Argon,輸出上限提至 1M token

    Google 於 2026 年 9 月 30 日發布新前沿模型 Gemini 4 Argon,先通過 Fairwind Program 向受信任的網路安全防禦方開放,之後再逐步提供給開發者、企業和消費者。它的輸出上限從 64K 提升到業界領先的 1M token,介紹價輸入每百萬 token 2 美元、輸出 10 美元,快取輸入享 95% 折扣。

9月29日星期二 · 6 則

  1. Hugging Face blogAI 評分53

    NVIDIA 開源表格基礎模型 Kumo Tabular,登頂四個基準

    NVIDIA 發布 Kumo Tabular,一個面向表格分類與迴歸的開源基礎模型,權重已上線 Hugging Face,程式碼開源於 GitHub。給定一張帶標籤行的表格,它在單次前向傳播中直接輸出新行的類別機率或數值預測,無需訓練、調參和特徵工程;模型僅用人工合成表格預訓練,提供 28M 到 215M 三種引數規模,採用 OpenMDW-1.1 許可證,可商用。

  2. OpenAI Codex changelog● 精選AI 評分88

    GPT-6.1 Sol 在 Codex 與 ChatGPT Work 上線

    GPT-6.1 Sol 現已在 Codex 和 ChatGPT Work 中提供,官方稱其複雜工作的表現接近 Astra,但成本低於 Astra。它適合程式碼、應用和文件類可重複、長時間執行的任務,呼叫模型名為 gpt-6.1-sol。可用性取決於你的套餐、客戶端和工作區設定,具體支援情況需查閱 Models 文件來對比與選擇模型。

  3. Ollama blog● 精選AI 評分82

    Ollama 0.35 支援 Jev 決策模型,本地低延遲

    Ollama 0.35 起支援基於 TypeSafe Jev API 的決策模型:通過新的 /v1/systemone 端點,把文字作為 state、配上一組命名問題,本機模型在一次請求裡全部作答,且無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble,以及 Together AI 的實驗性 4B tev1 和 0.8B tev1:0.8b,用 ollama pull 即可下載,可通過 curl 或 TypeSafe 官方 Python SDK 呼叫。

9月28日星期一 · 3 則

9月25日星期五 · 1 則

  1. X @AnthropicAI● 精選AI 評分70

    Claude 獨立算出九圈散射振幅,成本數千美元

    Anthropic 稱 Claude 在 Claude Science 中僅憑一條描述九圈問題的提示,基本無人監督執行數天,算出平面 N=4 超楊-米爾斯模型中的九圈散射振幅,總成本數千美元,打破此前八圈的紀錄。該結果由原紀錄保持者、SLAC 的 Lance Dixon 獨立驗證,物理學家兼科學作者 von Hippel 在 Anthropic 科學部落格撰文記錄。此前多數計算止步於兩到三圈,每加一圈計算量指數增長。

9月24日星期四 · 1 則

  1. Google DeepMind blogAI 評分50

    Gemini 3.8 Live 加入 Live Avatar 即時影片對話形象

    Google 於 9 月 24 日發布 Gemini 3.8 Live with Live Avatar,把近即時影片生成與語音結合,為企業的對話 AI 加上唇形同步、表情與流暢輪替的視覺形象,即日起在 Gemini Enterprise 提供。它支援非同步工具呼叫,可在對話不中斷的情況下後臺取數;原生語音到語音同步可跨 97 種語言切換,且不降低影片品質、不產生畫面漂移。

9月23日星期三 · 5 則

  1. X @Alibaba_QwenAI 評分15

    阿里 Qwen 發布新基準測試套件

    阿里 Qwen 團隊在 2026 年 9 月 23 日發布了一套基準測試套件,但公開資訊僅有一句“Benchmark suite:”,沒有披露測試專案、覆蓋模型、評分方式或開源地址等細節。目前無法判斷它針對哪類模型、是否包含 coding agent 或本地推理場景。

9月22日星期二 · 4 則

  1. OpenAI Codex changelog● 精選AI 評分92

    GPT-6 Sol 與 Luna 登陸 Codex 和 ChatGPT Work

    GPT-6 Sol 與 GPT-6 Luna 正陸續推送至 Codex 與 ChatGPT Work,token 價格低於上一代 GPT-5.6。Sol 適合複雜編碼與 agentic 工作流,Luna 面向高頻、聚焦型任務;Plus、Pro、Business、Enterprise、Edu 使用者均可使用,Free 與 Go 使用者可在桌面端使用 Luna。在 ChatGPT 中兩個模型只在 Work 和 Codex 提供、Chat 裡不可用,需在模型選擇器中選擇;

9月17日星期四 · 2 則

  1. X @Zai_orgAI 評分58

    智譜稱 GLM-5.3 兩週內自建推理基礎設施

    智譜分享 GLM-5.3 如何幫助建置並最佳化服務 GLM-5.3-Flash 的推理基礎設施,系統從首次跑通到可上生產不到兩週,端到端吞吐量達到初始基線的 3 倍。關鍵在於密集反饋:本地正確性測試、執行軌跡、微基準與端到端測量,讓團隊做有針對性的假設驗證,而不是隻看聚合效能指標。

9月15日星期二 · 1 則

  1. Gemini API release notes● 精選AI 評分61

    Gemini API 兩款即時語音模型正式可用

    Gemini API 於 2026 年 9 月 15 日讓兩款音訊到音訊模型正式可用(GA):gemini-3.8-live 與 gemini-3.8-live-extended-thinking,均通過 Live API 服務即時語音應用。前者是低延遲語音代理與即時對話的預設選擇,無推理延遲,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新。後者是高推理模型,可在即時音訊互動中做後臺推理,適合需要更強後臺推理的場景。

更早的內容