Ollama 上架 Nimble 與 Tev1 三款模型
Ollama 官方宣布三款模型已上架,可在 /v1/systemone 下使用:Nimble、Tev1 4b 和 Tev1 0.8b。三款模型均提供 ollama.com/library 頁面,使用者可通過 Ollama 拉取後在本地執行。官方未公布模型引數規模以外的細節與授權資訊。
Ollama 官方宣布三款模型已上架,可在 /v1/systemone 下使用:Nimble、Tev1 4b 和 Tev1 0.8b。三款模型均提供 ollama.com/library 頁面,使用者可通過 Ollama 拉取後在本地執行。官方未公布模型引數規模以外的細節與授權資訊。
Ollama 官方部落格宣布現已支援 Jev 風格決策模型,並同步上線決策能力文件與 API 文件。使用者可通過 Ollama 執行這類模型,具體用法和介面細節見官方文件。
Anthropic 宣布棄用 Claude Sonnet 4.5(模型 ID claude-sonnet-4-5-20250929),其在 Claude API 上的退役日期為 2026 年 11 月 30 日。官方建議遷移到 Claude Sonnet 5.5,詳情見 Model deprecations 文件。
Ollama v0.35.0 新增決策模型支援,通過 /v1/systemone 端點呼叫,基於 TypeSafe 的 Jev API。這類模型不返回文字,而是返回選擇、機率和分數,適合工單分流、模型路由和內容分類;目前可用 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1,用 ollama pull nimble 拉取。
Claude Code 發布 v2.1.285,新增環境變數 CLAUDE_CODE_DISABLE_WEB_FETCH 用於關閉 WebFetch 工具,並加入 allowedProviders 託管設定,限制一臺機器可用的 API 提供商(Anthropic API、自訂 endpoint、Bedrock、Mantle、Vertex AI、Foundry、AWS 上的 Claude Platform、Cloud gateway)。
v0.35.1-rc0 為 create 請求新增可疊加的 capabilities 欄位,Modelfile 也可直接寫 CAPABILITY 宣告,且這些宣告會在 GGUF 與 safetensors 的建立、繼承和 Modelfile 匯出中保留。排程 System One 請求前改為要求 decision capability,不再靠匹配 Qwen 的架構/renderer 後設資料。
Photo Scrubber 是一個實驗性工具,能自動識別照片中的人臉並打碼,同時按名稱所述移除後設資料,處理在本地完成。作者拍下抗議者照片後不願分享陌生人可識別的面孔,於是讓 GPT-6 Astra 做了這個工具。它使用 Google 的 MediaPipe C++ 庫,通過 @mediapipe/tasks-vision 編譯成 WebAssembly,人臉檢測採用 BlazeFace 模型。
MultiverseComputingCAI 發表論文提出 ProvenanceGuard:一個接在黑盒 MCP agent 之後的後生成驗證層,專門抓事實為真但歸屬錯誤的跨來源混淆,這類斷言可能被 RAGAS、MiniCheck 等只看合併證據的檢查器放過。它保留 MCP trace 中的 source ID,依次做斷言拆解、來源路由、支援度校驗與歸屬比對,輸出逐條來源判定和答案級的放行或攔截。
GPT-6.1 Sol 現已在 Codex 和 ChatGPT Work 中提供,官方稱其複雜工作的表現接近 Astra,但成本低於 Astra。它適合程式碼、應用和文件類可重複、長時間執行的任務,呼叫模型名為 gpt-6.1-sol。可用性取決於你的套餐、客戶端和工作區設定,具體支援情況需查閱 Models 文件來對比與選擇模型。
Ollama 0.35 起支援基於 TypeSafe Jev API 的決策模型:通過新的 /v1/systemone 端點,把文字作為 state、配上一組命名問題,本機模型在一次請求裡全部作答,且無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble,以及 Together AI 的實驗性 4B tev1 和 0.8B tev1:0.8b,用 ollama pull 即可下載,可通過 curl 或 TypeSafe 官方 Python SDK 呼叫。
ChatGPT 推出 Pro 500,月費 500 美元,是 Pro 系列中包含用量最高的方案,並在 ChatGPT Work 與 Codex 中提供 Astra Ultrafast。Ultrafast 是 GPT-6 Astra 的更快服務層,在模型選擇器中選用,先扣套餐內額度、用完再扣積分餘額;Pro 系列中只有 Pro 500 能用,Pro 100 與 Pro 200 即便買積分也不解鎖,上線時僅可通過網頁版 ChatGPT 訂閱。
Anthropic API 新增 Claude Sonnet 5.5(claude-sonnet-5-5),併成為預設 Sonnet 模型:1M 上下文,輸入 $2、輸出 $10 每百萬 token,快取讀取 $0.20 每百萬 token。
OpenCode 發布 v1.18.33:Cloudflare AI Gateway 上的模型現在會遵循 provider 的回應與流超時,Gemini 的 thinking 預設值與 effort 選項也與各代模型支援的控制對齊。同版本還讓 MCP 瀏覽器啟動失敗在啟動器立即退出時被報告,並讓除錯配置輸出遮蔽憑據與敏感 header。
Anthropic 發布 Claude Sonnet 5.5,已在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 上線。
OpenRouter 上線 Security Center,所有套餐型別均可用,入口在 Settings > Security,用於集中檢視並批次處理帳號下所有 API key。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行,無需手動切換。用法與以往一致,例如 ollama pull qwen3.8 後 ollama run qwen3.8。該版本目前為預發布版(v0.40.0-rc0,變更範圍 v0.34.4 到 v0.40.0-rc0),官方稱預發布期間會測試並啟用更多模型,尚未說明具體支援清單與效能差異。
Google 於 9 月 24 日發布 Gemini 3.8 Live with Live Avatar,把近即時影片生成與語音結合,為企業的對話 AI 加上唇形同步、表情與流暢輪替的視覺形象,即日起在 Gemini Enterprise 提供。它支援非同步工具呼叫,可在對話不中斷的情況下後臺取數;原生語音到語音同步可跨 97 種語言切換,且不降低影片品質、不產生畫面漂移。
Anthropic 自 2026-09-24 起,對在任何輸出前被拒、且 stop_details.category 為 bio、frontier_llm、reasoning_extraction 的請求恢復計費,按執行該請求的模型費率收取,所有平台適用;其他類別的輸出前拒答仍不計費,fallback credit 不變。流式輸出中途的拒答此前已在計費。
Google 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型,是 Gemini 迄今最有表現力的音訊生成模型,已在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 上線。
Claude API 的快取診斷已結束 beta,正式可用,不再需要 cache-diagnosis-2026-04-07 這個 beta header。開發者只要在 Messages 請求里加上 diagnostics 物件即可啟用;仍傳送舊 header 的請求行為保持不變。POST /v1/messages 的回應現在總會包含 diagnostics 欄位,請求未帶 diagnostics 物件時該欄位為 null。
ChatGPT iOS 版 1.2026.258 重設了主介面,並在橫屏下新增 iPad 分屏檢視,把任務列表與當前開啟的任務並排顯示。該版本還新增瀏覽巢狀 Git 倉庫內改動的支援,側邊對話會沿用附件、選中文字與評審評論,新任務會保留所選計算機並更好識別專案檢出與 worktree。修復項包括排隊提示開始時回覆顯示空白或不完整、裝置時鐘錯誤導致的配對失敗,以及 Mac 與 Linux 上的 SSH 連線問題。
llama.cpp 作者 Georgi Gerganov 宣布,現在可以直接用 transformers 執行 GGUF 格式模型。該工作把 ggml 的 Metal 核心引入 transformers 生態,提升了相容性與效能,具體細節見其後續說明。
Google 在 2026 年 9 月 22 日的 Gemini API 更新中,將 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型正式 GA,並新增 /v1beta/voices 端點。旗艦款 gemini-3.8-flash-tts 主打錄音棚級音質、細膩表演、地區口音與長時多輪穩定;
Anthropic 發布 Claude Opus 5.5,面向長時間執行的 agentic coding 與知識工作,預設 1M token 上下文、128k 最大輸出,每百萬 token 輸入 $4、輸出 $20(Opus 5 為 $5/$25),已上線 Claude API、Amazon Bedrock、AWS、Google Cloud 與 Microsoft Foundry。
OpenRouter 上線 Batch API:把大量請求打包提交,由供應商在 24 小時視窗內自行選擇完成時間,換取通常為按 token 正常價 50%(有時更低)的折扣,現支援 70 多個模型。兩週 beta 期內 23 萬多個批次的中位完成時間是 7 分鐘,90% 在一小時內,太平洋時間 5 點到中午提交明顯更慢。支援 chat completions、responses、messages 和 embeddings,結果逐條獨立返回,輸入與結果保留 30 天;
GPT-6 Sol 與 GPT-6 Luna 正陸續推送至 Codex 與 ChatGPT Work,token 價格低於上一代 GPT-5.6。Sol 適合複雜編碼與 agentic 工作流,Luna 面向高頻、聚焦型任務;Plus、Pro、Business、Enterprise、Edu 使用者均可使用,Free 與 Go 使用者可在桌面端使用 Luna。在 ChatGPT 中兩個模型只在 Work 和 Codex 提供、Chat 裡不可用,需在模型選擇器中選擇;
2026 年 9 月 22 日起,Google AI 訂閱使用者在 Colab 中獲得高階權益:優先使用更快的加速器和更強的機器;Google AI Ultra 訂閱者還解鎖後臺不間斷執行和 Premium GPU 訪問,長時間訓練不必一直開著瀏覽器標籤。已有 Colab 訂閱內容不變,Google AI 訂閱權益可以疊加。
Gemini API 在 2026 年 9 月 18 日的更新中把 Gemini 2.5 系列模型的存取權限限制為過去曾實際使用過它們的使用者。2.5 並未被棄用,仍會繼續通過 API 提供服務,直至另行通知。新專案官方建議改用最新的 3.5 Flash-Lite 或 3.8 Flash,官方稱這是為了給舊工作流和新應用都保留足夠容量。
ChatGPT 面向 iOS 發布 1.2026.251 版,新增在檔案選擇器中直接建立資料夾,並支援寫作塊(writing blocks),帶草稿候選與複製操作。任務側改進包括:每個專案會記住 worktree 模式與配置環境,排隊中的長提示詞改為緊湊預覽、點選展開,並修復重開後排隊提示詞丟失或顯示過期、worktree 任務卡片在配置完成後打不開等問題。
LM Studio 發布部落格,介紹 Bionic 中的 Introspection(內省)與 Session References(會話引用)兩項功能。官方給出部落格連結,供使用者瞭解詳情,但未在推文中說明具體能力、適用平台或版本要求。
Gemini API 於 9 月 17 日發布 antigravity-preview-09-2026,取代並棄用 antigravity-preview-05-2026,舊版將在 2026 年 10 月 5 日關停。若在遠端沙箱(environment: "remote")且只讀 output_text 或 model_output 步驟,只需更新 agent 字串,其他不變。
LM Studio 的 Bionic 現在可以引用並內省(Introspection)過往會話,在輸入框用 @ 提及即可引用其他會話,跨專案也支援。內省是一組寫在內建 SKILL 裡的漸進披露工具,採用分層設計與截斷策略以節省上下文,能讀取持久化的會話記錄,找回 compaction 時被丟棄的設計決策、環境資訊等細節,因此在耗時數小時的長任務中更能遵守原定計劃。讀取其他會話需經權限彈窗批准,以避免跨會話汙染;讀取當前會話自身的 transcript 則無需批准。
Gemini API 於 2026 年 9 月 15 日讓兩款音訊到音訊模型正式可用(GA):gemini-3.8-live 與 gemini-3.8-live-extended-thinking,均通過 Live API 服務即時語音應用。前者是低延遲語音代理與即時對話的預設選擇,無推理延遲,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新。後者是高推理模型,可在即時音訊互動中做後臺推理,適合需要更強後臺推理的場景。
DeepSeek 在 API 上線 V4.1-Flash,原生支援多模態,呼叫時把模型設為 deepseek-flash 即可。V4-Flash 與 V4-Flash-Vision-Exp 已退役,舊模型名暫時路由到 V4.1-Flash 以保持相容。多方測試顯示 V4.1-Flash 在效能、成本、速度和總執行時間上均優於 V4-Pro,V4-Pro 正被淘汰;
OpenRouter 在 2026 年 9 月 9 日推出美國 In-Region Routing,此前 EU 路由已於去年 10 月上線。把請求發到 us.openrouter.ai/api/v1 或 eu.openrouter.ai/api/v1,API key、請求體、模型 ID 不變,帳戶裡的 provider 偏好、fallback、隱私設定照常生效;
Mistral 為一家歐洲能源運營商把 4 萬行 Fortran 77 的油藏模擬器遷移到 C++,該程式碼庫既無測試套件也無集中文件。做法是先建數值一致性框架:在 Fortran 中匯出狀態快照,再用 C++ 測試框架核對最終結果與關鍵中間點,之後才讓 agent 動手。文件階段用自訂解析器生成呼叫樹,借 Vibe CLI 啟動上百個 agent 逐節點寫文件、結合 Mistral OCR 讀取舊 PDF,另有審查 agent 定時迴圈審 PR。
OpenRouter 發布 beta 版 openrouter:shell 服務端工具與 Files API,任何支援工具呼叫的模型都能在託管 Linux 容器裡執行命令並讀寫檔案。它相容 OpenAI 的 shell 工具(Responses API)和 Anthropic 的 bash 工具(Messages API),其中 bash 預設由你的應用本地執行,把 engine 設為 openrouter 才會在服務端沙箱執行。
Google 於 2026 年 9 月 3 日把下一代音樂生成模型 lyria-3.5 轉為正式可用(GA)。它支援文字與影像輸入,可生成整首歌曲,音樂連貫性與人聲自然度提升,並支援對時長和結構的細粒度控制,輸出 44.1 kHz 立體聲。開發者可在 Gemini API 的 Music generation 指南中檢視詳情與程式碼範例。
Ollama 於 2026 年 8 月 31 日推出按 token 計費的新 Pro、Max、Team 方案:Pro 每月 20 美元含 60 美元用量,Max 100 美元含 300 美元,Team 500 美元含 1000 美元共享額度且不限使用者數。新方案無服務費,也沒有 5 小時或每週上限,額度用盡後仍按同一 token 單價繼續計費,每月按訂閱起始日重置且不結轉。