使用者稱 Opus 5.5 消耗訂閱額度更快,300M token 觸頂
有使用者反映改用 Opus 5.5 後,每週僅用 300M token 就觸及訂閱上限,而此前每週消耗 1-2B token 都沒問題。該使用者指出 Opus 5.5 單 token 價格理論上更低,懷疑是訂閱額度被削減,或與自己大量使用 subagent 有關。目前尚無官方說明。
找到 50 筆
有使用者反映改用 Opus 5.5 後,每週僅用 300M token 就觸及訂閱上限,而此前每週消耗 1-2B token 都沒問題。該使用者指出 Opus 5.5 單 token 價格理論上更低,懷疑是訂閱額度被削減,或與自己大量使用 subagent 有關。目前尚無官方說明。
OpenAI 發布名為 Ultrafast 的高階速度檔,在 Codex 中 token 生成速度最高提升至 8 倍,達到每秒 300 token;在 API 中最高提升至 6 倍。該檔位定位為付費高階速度層,官方未公布價格與具體可用範圍。
openJiuwen 團隊發布自演進模型路由技術 X-Router,在 PinchBench 全量 147 個任務實測中,靜態路由得分 66.3%、成本 $8.25,相比全量呼叫 Kimi-K2-Thinking 的 71.36%、$11.11,成本降低 44.6%。該技術基於五檔複雜度分檔路由,用本地 Qwen3-0.6B 做程序內分類器,支援端雲分級與 Bandit 自演進,並已接入 WorkSwarm 的 MoA 多模型協同。
Anthropic 發布一篇思想實驗文章,探討「每秒 100 萬 token」的四種含義:上下文容量、輸入處理速度、聚合吞吐量和單智慧體輸出速度,並強調這不是對任何現有模型的實測。文中以 Claude Opus 5.5 為例,其上下文視窗為 100 萬 token,但單次請求輸出上限遠小於此。文章用互動計算器演示:若單智慧體達到每秒 100 萬 token,1000 個故事結局約 1 秒寫完,但加入 60 秒固定檢查後,端到端加速從 10000 倍降至 132.57 倍。
Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。
llama.cpp 合併 PR #29622,在單一批次中同時支援嵌入向量(embd)和原始 token,並新增 llm_arch_supports_mixed_batch 為 false 時的檢查分支。改動包括固定圖拓撲、為混合場景設定專用輸入、移除 set_tensor_backend、將 is_embd 改為 type,並統一 m-rope 位置處理。
Ollama 於 2026 年 8 月 31 日宣布 Pro、Max、Team 計劃改用按 token 的透明定價,每個計劃含每月重新整理的用量額度:Pro 每月 20 美元含 60 美元用量,Max 每月 100 美元含 300 美元,Team 每月 500 美元含 1000 美元共享用量且不限席位。免費計劃也提供少量入門模型額度,可充值按量付費使用全部模型。
Google DeepMind 於 2026 年 9 月 30 日發布前沿模型 Gemini 4 Argon,先通過 Fairwind Program 向受信任的網路安全防禦方開放,隨後逐步擴充套件。其輸出 token 上限從 64K 提升至行業領先的 1M,定價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入享 95% 折扣。
TypeSafe AI 聯合創始人兼 CEO Diogo Almeida 在 Latent Space 訪談中透露,其 System-One 模型 Jev 估值達 100 億美元,日處理量已突破一萬億 token,且夜間流量持續走高,說明大量呼叫來自機器自動化。Jev 1.13.0 在第三方 JevBench v1.2.1 綜合榜以 75.3 分排名第一,發布影片 6 天瀏覽量超 3870 萬。
Google 於 10 月 1 日突然發布 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超過 Claude Opus 5.5 和 GPT-6 Astra,Vals Index 以 68.90% 登頂,Text Arena 以 1525 分居首。優惠期單題成本約低四成,每百萬輸入 Token 2 美元、輸出 Token 10 美元,支援百萬 Token 輸出。目前僅開放給經篩選的網路安全團隊,通過 Fairwind 計劃使用,其他訂閱使用者需等待。
開發者發布 DensePack,將 Read 讀取的文字檔案、Bash 輸出、Word 文件和子代理報告打包成圖片供 agent 讀取,聲稱按約 50% 的價格完成同樣的文字 token 化,且後續快取讀取也按這一折扣計費。作者稱已跑過逾 1 萬次基準測試,圖片用獨特配色加兩行圖例,可從圖片逐位元組還原始碼檔案,並保留文字副本作為校驗回退。專案發布兩週獲 8 個 star,已通過 Anthropic 外掛提交的初期階段,最新版本 1.3.3,1.4 計劃支援與其他外掛共用。
企業一度鼓勵員工儘可能多地使用 AI,即所謂的 #tokenmaxxing,隨後賬單隨之而來。報導援引一項針對近 400 家企業的調查稱,其中只有 11% 能準確預測自己的 AI 支出。AI 使用量以 token 計量,而企業發現 token 很難統計,這讓 AI 預算幾乎無法編制。
Anthropic 推出 Claude Opus 5.5,面向長時間執行的 agentic coding 與知識工作,預設 1M token 上下文、128k 最大輸出,並強制開啟自適應思考,價格從 Opus 5 的 $5/$25 降至 $4/$20 每百萬 token。
一位使用者用同一提示詞讓 Opus 5.5 和 Sol 6.1 在 15 分鐘內用 three.js 建置簡化版布萊德湖城堡,要求可環繞旋轉相機並保持寧靜氛圍。Opus 5.5 用時 5 分 46 秒,約 30 萬輸入加 1.8 萬輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 40 萬輸入加 1.6 萬輸出 token,估算成本約 0.96 美元。
Claude Code 更新至 v2.1.284,Anthropic API 新增 Claude Sonnet 5.5(claude-sonnet-5-5)並設為預設 Sonnet 模型,支援 100 萬 token 上下文,定價為每百萬 token 輸入 2 美元、輸出 10 美元,快取讀取 0.2 美元。
德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。
一項研究分析了離散擴散模型(含 remasking 與 uniform-state 取樣器)的單步生成機制,指出一步生成只有在所寫位置在已固定 token 條件下相互獨立時,才與訓練分佈匹配。研究證明,任何逐位置分佈的乘積都無法匹配存在依賴關係的 token 組,而畫素、音素、詞等常見領域中的 token 本身存在固有依賴。
NVIDIA 於 2026 年 8 月 11 日發布 Nemotron 3.5 Lightning,並已上線 Ollama,可完全在本地裝置執行。該模型為 30B 總引數、每 token 僅 3B 啟用的開放模型,採用混合 MoE 架構,支援最高 1M token 上下文,面向持續執行的 agent 任務。
一位使用者用自訂 Pi agent 搭配 High 思考檔位的 Opus 5.5,耗時 27 分 45 秒、花費 6.17 美元(主 agent 4.97 美元、設計審查 agent 1.21 美元),產出一個 1029 行、零依賴的 HTML 檔案。輸出 122,689 tokens,其中思考 66,163 tokens;總 token 約 600 萬,約 95% 為快取讀取。
GPT-6 Sol 和 GPT-6 Luna 正陸續登陸 Codex 與 ChatGPT Work,token 價格低於前代 GPT-5.6。Sol 面向複雜編碼與 agentic 工作流,Luna 面向高頻聚焦任務。Plus、Pro、Business、Enterprise、Edu 使用者可逐步獲得,Free 與 Go 使用者可在桌面應用使用 Luna;Enterprise 管理員需手動啟用。ChatGPT 中僅 Work 和 Codex 可用,Chat 不可用;
輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。
MLX 發布 v0.40.0-rc1,核心改動是讓本地 tokenizer 與模型發布方的語義保持一致,涵蓋預分詞階段順序、切分行為、Unicode 邊界、added token 歸一化和 BPE 合併排序,並統一處理空 added token 與空 Metaspace 輸入。同時新增 Go/Python 共享參考用例,直接拉取缺失模型並在出錯時失敗,另加配置優先順序、位元組回退與並行編碼的迴歸測試。
OpenRouter 上線 Batch API,把請求打包提交後由服務商在 24 小時內擇時完成,換取約為正常每 token 價格 50% 的折扣,目前已支援 70 多個模型。兩週 beta 期間 23 萬多個批次的中位完成時間為 7 分鐘,90% 在一小時內完成;太平洋時間凌晨 5 點到中午提交明顯更慢。支援 chat completions、responses、messages 和 embeddings,輸入結果保留 30 天,圖片和檔案需用公開 URL。
德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,總引數 78B、啟用 3.46B,支援最高 100 萬 token 上下文,採用 Apache 2.0 許可。模型基於 20T token 的英德雙語語料訓練(約 62.5% 英語、23.9% 德語、13.6% 程式碼),在 768 張 B300 叢集上訓練約 4 周。社群討論認為其基準表現接近 Qwen 3.5 35B,適合 96GB 視訊記憶體本地部署,但目前尚無量化版本。
llama.cpp 發布建置 b11418,其 server 新增對 Clef 的視覺輸入支援(PR #29969),並修復影像 token 上限、abort 與 yield_to_queue 資料變更等問題。
有使用者在 Reddit 發帖指出,近期開源與閉源新模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和擴充套件詞彙,用更少字詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與追求 token 效率有關,但代價是普通讀者難以一眼讀懂,例如輸出中出現 Baudrillardian 這類需要背景知識才能理解的詞。
Google 在 9 月發布新一代前沿模型 Gemini 4 Argon,具備先進推理能力與 100 萬 token 輸出上限,目前通過 Fairwind Program 向受信任的網路安全防禦方分階段開放。
Reddit 使用者 pensuke89 發帖稱,ChatGPT Plus 的每週用量額度從原先約 80-100 美元 API 等值降至穩定在 49-50 美元,5 小時限額約為 7-8 美元。評論區有使用者指出,OpenAI 已宣布將 200 美元檔位的 API token 額度減半,其他檔位可能同樣被減半。該帖未提供官方確認。
有使用者在 Reddit 發帖討論對 Kimi K3.5 的期待,稱 K3 已是令人喜愛的模型,好奇 K3.5 會有多強。帖主回顧稱 K2 已經不錯,K2.5 憑藉持續學習階段提升到全新水平,據其記憶使用了超過 20-25T token。該帖未提供 K3.5 的發布時間、引數或官方資訊。
OpenAI 發布 GPT-6.1 Sol,定價每百萬輸入/輸出 token 2/10 美元,遠低於 Astra 的 10/50 美元,官方稱其在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分。Sonnet 5.5 在 Agent Arena 首秀排名第 3 並在 Chat 類別登頂,Anthropic 模型包攬前三。Codex 用量於 10 月 2 日太平洋時間上午 10 點全球重置。
llama.cpp 合併多項改動,將 indexer 分數視訊記憶體佔用減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現改為逐頭計算並原地累加為單個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 頭、Metal 以函式常量讀取頭數、Vulkan 按 64 鍵×8 token 分塊並改用 fp16 點積,indexer 改為呼叫 ggml_lightning_indexer 且鍵只讀一次。
阿里推出新一代原生全模態模型 Qwen3.8-Omni-Flash,已在千問 AI 平台上線,支援文字、影像、音訊、影片輸入,上下文視窗達 100 萬 token。該模型在 29 項評測中平均分較 Qwen3.5-Omni-Plus 提升超 25%,音影片輸入價格分別下降超 98% 和 93%,並開源 Qwen-Live Harness 即時執行時。
GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放,執行在 NVIDIA Blackwell GPU 上。官方稱其 token 生成速度最高可達 Astra Standard 模式的 8 倍,可縮短 coding agent 的編輯—測試—除錯迴圈,並減少工具呼叫之間的等待。開發者可通過 API 使用,訪問方式、價格與實現細節見 Ultrafast 指南。
Meta Superintelligence Labs 於 2026 年 7 月 9 日發布 Muse Spark 1.1,這是 Muse Spark 的升級版多模態推理模型,面向 agentic 任務,在工具與電腦操作、程式設計和多模態理解上有明顯提升。模型支援 100 萬 token 上下文視窗,可編排多智慧體系統,並已在 Meta AI 應用和 meta.ai 的 Thinking 模式上線。
一位使用者在 Blender 中使用 Claude Opus 5.5 時發現,直接畫出空間意圖比用文字描述形狀更高效。文字擅長說明物體是什麼,卻難以表達位置、大小和數量,因此他改為提供草圖或空間參考。整個專案共消耗 3300 萬 token,API 成本 16.07 美元,執行 48.5 分鐘。
Anthropic 於 2026 年 9 月 23 日宣布,其生命科學研究團隊用 Claude 自主發現了一種與 DNA 重複序列相關的新型酶系統,命名為 array-associated reverse transcriptases(ART)。約 950 個 agent 在 21 小時內消耗 2.1 億 token 掃描 DNA 資料庫,其中一個 agent 注意到某逆轉錄酶基因旁存在重複序列模式,隨後經實驗室驗證確認。
一位使用者表示 6.1 Sol 效率很高,兩小時編碼任務僅消耗每週額度的 2-3%,在 100 美元套餐下很難用完額度,因此考慮降級到 20 美元套餐,但擔心後者 5 小時限制過於受限。該使用者稱願意用速度換取 token 效率,並詢問是否有人也在考慮降級。
德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,總引數 78B、啟用引數 3B,支援最長 1M token 上下文,權重已在 Hugging Face 開放下載,採用 Apache 2.0 許可。該模型為英德雙語 MoE Transformer,面向公共管理、工業與航空航天等受監管領域,在 AIME 2025 上得分 96.9,官方稱其效能可對標啟用引數四倍於己的模型。
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
Google Antigravity SDK 現已支援在本地執行離線 agentic 工作流,可通過 LiteRT 呼叫 Gemma 4 26B A4B 等模型。該更新支援混合編排架構,由雲端模型擔任輕量規劃器,本地模型在裝置上處理程式碼審計與修補等高 token 消耗任務。SDK 還直接相容 Ollama、vLLM 等 OpenAI 相容推理伺服器,便於建置隱私優先的本地自主工具。
OpenAI 於 2026 年 10 月 2 日發布 GPT-6 系列模型指南,該系列包含三款模型:GPT-6 Astra(輸入 $10/輸出 $50 每百萬 token)、GPT-6.1 Sol(輸入 $2/輸出 $10)和 GPT-6 Luna(輸入 $0.1/輸出 $0.5)。指南建議按任務難度匹配模型與推理等級,並利用提示快取(快取輸入最高便宜 95%)和壓縮控制成本,同時提供 Fast 與 Ultrafast 加速模式。
有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。
llama.cpp 合併 b11405 版本更新,為 lightning indexer 在 CUDA 與 ROCm 後端新增分塊核心,針對 4 頭場景最佳化。新核心將鍵以半精度暫存、查詢逐頭載入,每執行緒負責一個鍵對兩個 token,避免點積的跨執行緒歸約;同時把乘積改為 float 計算以防 half2 溢位,並讓每個鍵元素只擴充套件一次供所有頭使用。ROCm 上內層迴圈展開 8 次,gfx908 僅用 63 個 VGPR 無溢位,R9700 上核心提速 36 倍。
月之暗面發布 Kimi K3,2.8T 引數,號稱全球首個開源 3T 級模型,具備原生視覺與 100 萬 token 上下文,已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用最高思考強度。官方稱其整體效能仍落後 Claude Fable 5 與 GPT 5.6 Sol,但在自測中達到前沿水平,並優於其他受測模型。完整權重將於 2026 年 7 月 27 日發布,技術報告隨後公布。
AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。
Meta 的消費級 AI 產品 Muse 已在美國 App Store 榜首停留一段時間。其核心能力(瀏覽器與電腦操作、雲端工作流、定時任務、手機遠端控制)在 Codex、Claude Code 等工具中已存在一年多,Muse 的差異在於把複雜選項抽象為單一聊天介面,並靠廣告而非賣 token 變現,免費額度因此相當寬鬆。作者認為這可能是 agentic AI 首次對普通消費者變得可理解。
Cloudflare 在生日周宣布,將歐洲兩個公共機構訓練的開源模型 EuroLLM 和 Apertus 引入 Workers AI,現已開放訪問申請。EuroLLM 覆蓋 35 種語言,含全部 24 種歐盟官方語言;Apertus 由瑞士 ETH Zurich、EPFL 等開發,訓練資料超 15 萬億 token、覆蓋 1500 多種語言,權重與資料全部公開。Cloudflare 同時啟動面向政府網路安全機構與關鍵基礎設施運營方的實操工作坊,首場 10 月在新加坡舉行。
handoff-compact 是一個 Claude Code 外掛,在 autocompact 觸發時不再使用內建摘要,而是讓會話分支寫出一份交接文件(目標、狀態、下一步、決策、排除方案、待解問題、檔案與提交、驗證命令、最近 10 條提示原文),再用它替換原對話,相當於在同一會話中自動完成 handoff + /clear。作者稱長時間無人值守會話中約一半 token 花在上下文已超 200k 的輪次上,既貴又因上下文腐化影響品質。
Percepta 公布新架構 Spotlight,用可讀寫記憶取代注意力機制,宣稱是首個實現記憶無限增長而不增加訪問成本的架構。每個 token 只讀寫少量記憶單元,稀疏度可任意調節,不像 MoE 那樣固定啟用比例。該架構把負責計算的智慧模組與存放知識、流程和狀態的記憶分離,模型權重不隨記憶增長而改變,可自行決定載入與覆寫,從而無需重訓練即可獲得新能力。
Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),要求用 Three.js 渲染,模型執行約 2 小時後寫出 5500 行程式化渲染程式碼。他認為這類任務標誌 LLM 測試正走出「畫個騎腳踏車的鵜鶘 SVG」階段,因為沒人會花時間做這種高度定製的作品,而 LLM 有無限耐心。他也指出弱點:LLM 無法原生高效地觀看影片或玩遊戲,Opus 5 只能緩慢截圖檢查,多次出錯並留下不少瑕疵。