微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分
微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。
微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。
Simon Willison 已傳送九月贊助者專屬月度通訊,贊助者可立即訪問。本期涵蓋更多 Fable 級模型、一場價格戰、3D 圖形與 Blender、LLM 進軍數學、更多意外網路攻擊、Datasette 漏洞危機、作者當前使用工具、本月軟體發布及 2026 年 LLM 進展回顧。訂閱費為每月 10 美元,可提前一個月看到免費版內容。
Cloudflare 宣布 Artifacts 進入公開測試,並舉辦比賽,邀請開發者用 Workers 和 Artifacts 建置面向 agent 的下一代 Git 平台。Artifacts 是可程式設計的版本化檔案系統,支援 Git 操作、程式化建立和 fork 倉庫,可擴充套件到數百萬倉庫。
Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。
Kolibri 技術報告已發布,主題為高效推理。報告以 PDF 形式公開,發布時間為 2026 年 10 月 3 日。目前公開內容僅為 PDF 檔案本身,未提供更多關於模型規模、效能資料或使用方式的細節。
RetailReady(YC W24)正在招聘實施崗,薪資 10 萬至 14 萬美元,股權 0.02% 至 0.06%,工作地點舊金山,需每月出差至客戶倉庫約 50% 時間,僅限美國公民或持美國簽證者。該公司做 AI 供應鏈合規引擎,已融資 660 萬美元,客戶超 50 家,過去 12 個月營收增長 4 倍,團隊 12 人,面試為 15 分鐘初聊、30 分鐘小組面、創始人面。
EventMaxxer 是一個開源工具,讓 coding agent 根據你的目標、地點和日期自動發現匹配的 meetup、會議、工作坊、晚宴和駭客松,並批次申請免費活動。它把結果同步到 Google Sheets 或 CSV,按日期排序,記錄報名狀態、出席決定和備註,還支援自動恢復被限流的任務。需要 agent 有可用的已登入瀏覽器,可選本地 runner 要求 macOS/Linux 上的 Python 3.9+,Google Sheets 需要聯結器。
Uisato Studio 上線 Oscilloscope Diffusion,一種通過擴散模型干預已有影片的新方法:以原影片的運動與形態為起點,重新詮釋其紋理、材質與視覺語言。演示素材來自作者的 TouchDesigner 音訊反應幾何視覺化系列 Oscilloscopes, everywhere(已更新至 v1.2),也可輸入任意影片源。使用者可選擇源影片、用提示詞描述處理方式,並通過精選 LoRA 與可編輯時間線控制結果與原始畫面的接近程度。
OpenAI 發布了 GPT-6 系列的模型指南,內容涵蓋模型選擇、推理強度(reasoning effort)與工具使用。該指南面向使用 GPT-6 系列的開發者,幫助其在具體場景中決定選哪個模型、投入多少推理算力以及如何呼叫工具。原文未披露具體模型型號、引數或發布時間等細節。
AI 使用者研究平台 Great Question(YC W21)正在加拿大遠端招聘首位產品工程師,年薪 15 萬至 18 萬加元,要求 6 年以上經驗。崗位為全棧方向,技術棧以 Rails 與 TypeScript 為主,工作內容涵蓋影片流、即時語音 agent、agentic 搜尋等,並明確要求日常使用 Claude Code、Codex、Cursor 等 agentic 編碼工具。該崗位僅限美國公民或持美國簽證者申請。
德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它是 78.1B 引數的 MoE 模型,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,FP8 權重約 78 GB,知識截止 2026 年 6 月 18 日。
德國 Aleph Alpha 於 2026 年 10 月 3 日發布 Kolibri,一個英德雙語 MoE Transformer,總引數 78B、啟用 3B,支援最長 1M token 上下文,權重已在 Hugging Face 以 Apache 2.0 許可開放下載。它面向公共管理、工業與航空航天等受監管領域,針對德語、推理、數學與 agentic 行為做了專門最佳化,官方稱其品質與服務成本處於帕累托前沿,數學、程式碼、長上下文等基準可對標啟用引數最多四倍於己的模型。
Offrun 是一個統一工作區,用來管理多個 coding agent,並加入第二 agent 做 peer review:在你檢視 diff 之前先審閱,發現的問題會出現在聊天裡,此時改動尚未提交。你可以要求修復,修復內容會先進入訊息框供你確認,不會自動合併。它執行在你自己的 agent 帳號上,不需要額外訂閱,也不會在 pull request 上放機器人。
LiquidAI 發布 LFM2.5-Encoder,含 350M 與 230M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度任務。官方稱其吞吐量追平或超過 ModernBERT,CPU 長上下文更強,並可通過 WebGPU 在瀏覽器執行;GGUF 權重已發布,llama.cpp 支援 PR 已提交。
特斯拉將 Robotaxi 的運營時間從晚上 10 點推遲到 11 點,原因是夜間難以看清路面上的寵物,尤其是深色路面上的灰色小貓。馬斯克稱核心目標是避免在夜間碾到寵物。
Cloudflare 今年秋季推出 OHTTP Gateway,作為付費附加元件讓客戶在自有域名上接收 OHTTP 流量,現已開放等待名單。OHTTP 通過中繼與閘道器兩跳分離,使應用後端看不到使用者 IP;此前已用 Cloudflare 保護伺服器的客戶無法使用其 OHTTP Relay,現在可改用第三方中繼加 Cloudflare 閘道器。閘道器執行在 Cloudflare 全球邊緣網路,可減少中繼到閘道器及閘道器到源的延遲。
Google Maps Scraper MCP 是一個遠端 Model Context Protocol 伺服器,讓相容的 AI agent 直接搜尋商戶並拿到結構化結果。它通過 https://gmapscrawl.com/api/mcp 提供無狀態 Streamable HTTP 介面,用 Bearer API key 認證,單次最多返回 20 家商戶的地址、聯絡方式、評分與評論數。
MegaCapybara 是專為 RTX5090 打造的推理引擎,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單路編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。它自帶權重格式與後設資料,載入前會展示各量化設定相對 BF16 的 KL 與 top-1% 損失,並支援智慧 VRAM-RAM-DISC 快取、Loop Guard 與圖形介面。採用 MIT 許可,原始碼與權重建置器稍後發布。
Cloudflare 的決策模型現已在 Ollama 上提供,可用於影像分類、給 bug 報告打標籤或把支援工單路由到正確團隊。共兩個型號:Clef(27B)用 ollama pull clef 拉取,Clef Flash(9B)用 ollama pull clef-flash 拉取。
Ollama 官方帳號發布了兩條模型庫連結:Clef Flash 和 Clef,地址分別為 ollama.com/library/clef-flash 與 ollama.com/library/clef。原文未給出模型引數、量化版本、許可或效能資料,具體資訊需開啟頁面檢視。
Meta 推出開源專案 Muse Gadgets,開發者可用官方開源韌體和 Linux SDK 自製硬體連線其個人 AI 助手 Muse,支援樹莓派、ESP32 等開發板,接入螢幕、按鈕、感測器與執行器。Meta 還免費發放 5000 臺 Muse Home Link(USB-C 供電,讓 Muse 連線家庭網路並控制智慧音箱、電視),限 Muse 訂閱者先到先得,預計數週內發貨。
OpenAI 開發者帳號發布提醒,讓正在使用 Agents API 建置應用的開發者瞭解最新變化,但正文未披露具體更新內容、發布時間或功能細節。目前只有一句引導語,沒有可操作的資訊。
OpenAI 開發者帳號發布 dot,它能學習使用者的工作方式、跨應用保留上下文、協調 Codex 任務,並標記需要使用者關注的事項。目前官方只給出這四項能力描述,未公布定價、可用平台與上線時間。
OpenAI 開發者帳號 @OpenAIDevs 在 2026 年 10 月 2 日發布了一條 X 帖子,正文只有一個指向 X 文章(x.com/i/article/2106076978206175232)的連結,沒有附帶任何文字說明。目前公開可見的資訊僅此一條連結,文章的具體內容、涉及的產品或發布時間均未在帖子正文中披露。
OpenAI CEO Sam Altman 表示,Cerebras 是 OpenAI 的緊密合作夥伴,雙方正深度合作推進速度前沿。此番表態針對外界對兩家合作關係的猜測。
開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。
Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;
Google Cloud API Gateway 現在可原生充當遠端 MCP 伺服器,無需再自建和維護中介軟體就能把 REST API 暴露給 AI agent。開發者只需在現有 OpenAPI 3.x 規範中加入 x-google-api-management.mcp 等註解,即可把標準 REST 操作轉成可被發現的 agent 工具。
MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,在預訓練與中期訓練階段的所有 held-out 評測上與原版 PyTorch-on-GPU 參考實現精確一致。實現最高達到 57.4% MFU,且在不改動訓練配方的情況下撐過了執行中的叢集縮擴容和跨代 TPU 切換,驗證了基礎設施的可移植性。
開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。
Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。
Meta Superintelligence Labs 於 7 月 9 日發布 Muse Spark 1.1,是 Muse Spark 的多模態推理升級版,主打 agentic 任務,在工具與計算機使用、編碼、多模態理解上提升明顯。模型可主動管理 100 萬 token 上下文,能作為主代理編排並行子代理,在 OpenCode 中演示了自動截圖定位並修復 bug。
匹茲堡大學 HERL 實驗室聯合 ATDev 推進 RAMMP 輔助機器人專案(7 月 27 日發布),用 Meta 開源的 DINO、DINOv3 和 SAM 視覺模型做環境感知,專案獲美國 ARPA-H 最高 4150 萬美元資助。美國約有 550 萬輪椅使用者,每年逾 10 萬起輪椅相關傷害送進急診。團隊把模型最佳化到電池供電的邊緣裝置上執行:降低記憶體佔用、按需使用低精度、控制解析度與批處理,以犧牲少量邊界精度換取即時性與穩定性。
Meta Superintelligence Labs 發布首個媒體生成模型 Muse Image,並預覽 Muse Video。Muse Image 今天已在 Meta AI app、meta.ai、美國 Instagram Stories 和部分國家 WhatsApp 上線,Facebook 即將推出;它能呼叫搜尋與編碼工具、自我反思改進,並隨測試時計算提升品質。
Meta 發布 Brain2Qwerty v2,無需手術植入,即可從非侵入式 MEG 腦訊號即時解碼出連貫句子,詞準確率達 61%,遠高於其他無創方法的 8%,最佳受試者達 78%,其中過半句子錯誤不超過一個詞。模型用 9 名志願者、每人佩戴 MEG 邊打字邊記錄 10 小時、共約 22,000 句的資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。
Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;
Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;
Kimi 團隊開源 WorldVQA,一個用 3500 組影像-問題對衡量多模態大模型視覺世界知識事實正確性的基準。資料分 9 大類,36% 中文、64% 英文,並區分常見(Head)與長尾(Tail)知識,全部經過多階段人工校驗。測試顯示前沿模型長尾題準確率常低於 50%,且普遍過度自信:表現最好的 Kimi-K2.5 校準誤差 ECE 為 37.9%、斜率 0.550,距理想值仍有明顯差距。資料集與評測指令碼已開源。
Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。
Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。