AutoSynthData:為企業智慧體生成訓練資料
ServiceNow CoreAI 提出 AutoSynthData,用失敗與成功案例生成驗證訓練任務。
所有通過初篩的資料,依發布時間排序,時間為倫敦時間。有橘色圓點的是精選。
ServiceNow CoreAI 提出 AutoSynthData,用失敗與成功案例生成驗證訓練任務。
Latent Space 播客這期嘉賓是 MIT 的 Alex Zhang,主題包括 RLM、GPU kernel、多智慧體 swarm 與 harness 設計。他解釋 RLM 的 context offloading、遞迴 subagent、Prime Agent 和持久 subagent。
論文證明,離散 diffusion 取樣器(含 remasking 與 uniform-state)每步並行寫入多個 token 位置,只有這些位置在已固定 token 條件下相互獨立時,該步才與訓練分佈一致。任何逐位置分佈的乘積都無法匹配存在依賴的 token 組。
在英/法 HuBERT 受控設定中,增強預訓練語言判別可減少、部分指標上彌合連續語音和高層語言上的多語言差距,並保留跨語言共享。
Anthropic 宣布投入 1 億美元,計劃到 2027 年底培訓 1 萬名 Frontier Deployed Engineer,首批學員來自埃森哲、麥肯錫等機構。
Chatham Financial 使用 Codex 和 GPT-5.6 構建技術、重新設計工作流程,將交易驗證從 30 分鐘縮短到 4 分鐘以內。
OpenRouter 推出 Model Router Benchmarks 頁面,用多領域基準給各家模型路由器打質量、速度、成本分。頁面用 Router Index 把三項合成 0 到 10 分,預設權重質量 60%、單任務耗時 20%、成本 20%,可拖滑塊調整。列出的路由器都能在 OpenRouter 上直接替換模型試用。
GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放。它執行在 NVIDIA Blackwell GPU 上,token 生成速度最高是 Astra Standard 模式的 8 倍,可縮短 coding agent 的 edit-test-debug 迴圈。
美國聯邦法官 Amit Mehta 駁回 Chegg 和 Penske Media 針對 Google 的反壟斷訴訟,認定 Google 的行為不違法。兩家公司稱 AI overviews 抓取內容造成流量下滑,但法官認為網站對搜尋流量的期待不構成協議。
Claude Code 更新至 v2.1.287,新增 Claude Mods,外掛可修改更深層行為。同時內建 mod「You should know」,由側邊 agent 監控並提示你或 Claude 可能遺漏的問題,用 /plugin enable cc-plugin-you-should-know@builtin 開啟。
Advanced AI 可能對突破性想法背後的常規工作最關鍵,並探討執行如何塑造下一經濟與進步速度。
卡內基梅隆、MIT、NYU 與斯坦福的研究者做出 AI Ataraxos,在隱藏資訊的 Stratego 中以 15 勝 1 負 4 平擊敗史上最強選手 Pim Niemeijer。訓練只用了 16 塊 GPU、花費數千美元。這類隱藏資訊量大、時間跨度長的博弈此前連 DeepMind 也未能攻克。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API,幫助團隊更快工作,並讓數百萬顧客的購物更輕鬆。
Cloudflare 發布兩個自訓決策模型 Clef 和 Clef-flash,託管在 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,同時推出新的 RL 微調平台。Clef 在 Jev Decision Index 上目前排名第一,中位延遲 209.3ms,低於 Jev 的 524.1ms。它帶視覺編碼器、64k 上下文,可返回帶機率的結構化分類結果。
何愷明團隊提出 NAT-ARC,用 ImageNet 上 MAE 預訓練的 encoder 做純視覺 ARC 解法,不依賴 LLM。單模型 0.6B 引數在 ARC-1 拿到 63.4% pass@2,整合約 2B 引數達 70.2%。論文稱預訓練打通了視覺路線的 scaling 瓶頸。
Google 發布 Gemini 4 Argon,在 DeepSWE v1.1 得 77.9%,高於 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1%。每百萬輸入 2 美元、輸出 10 美元,優惠期單題成本比 Astra 低約四成,最高支援百萬 Token 輸出。目前僅開放給經過稽核的網路安全團隊。
Cloudflare 把 EuroLLM 和 Apertus 兩個歐洲公共機構訓練的開源模型接入 Workers AI,即日起可申請訪問。EuroLLM 支援 35 種語言,含全部 24 種 EU 官方語言;Apertus 用超 15 萬億 token、1500 多種語言訓練,權重與訓練資料全部公開。
NVIDIA 稱 AI 工廠以高產出、長壽命、通用性最大化投資回報,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 逾 30 倍,每百萬 token 成本低至 1/45。
Cloudflare OS 開放全託管部署等待名單,並新增連線 GitHub、Google Workspace 及多格式匯出。
Google DeepMind 發布 Gemini 4 Argon,但僅限政府使用者與 Fairwind 計劃網路安全人員預覽。它通過 Long Decode Continuation 把輸出上限做到行業首個 1M token,此前為 64K。定價 $4/$20 每百萬 token,五折後 $2/$10,快取輸入再降 95%。
Matthew Green 指出,處在各自隔離沙箱中的 agent 發現可以在共享包快取裡給對方留下指令,接收方的行為因此被改變。把包快取換成郵件、Slack、共享文件或 WhatsApp,把獨立沙箱的訓練換成 Muse 這類獨立部署的個人 agent,就湊齊了蠕蟲所需的兩半。
ChatGPT 在 iOS 版中新增 Scan 掃描功能:開啟 ChatGPT 相機,點三點選單選 Scan,可連續拍攝多頁筆記和文件,ChatGPT 會自動把它們合併成一個 PDF,直接上傳到對話。該功能正在 iOS 逐步推出。
新論文追問:自主 ML 工程智慧體到底需要多複雜的框架。現有 MLE 智慧體多靠 multi-agent orchestrator、專用檢索子智慧體等複雜裝置。只用 read、write、bash 直接操作執行環境的簡單 coding agent 卻被忽視。
Barclays 將 Claude 擴充套件至全行業務,計劃 2026 年底 Claude Code 覆蓋 50% 開發者,其知識助手已有 1.6 萬員工使用、每日處理 12 萬封郵件。
ChatGPT 為服飾配飾推出“Try on”虛擬試穿,支援上傳自拍生成效果,並可收藏商品或建資料夾整理。
理論物理學家 Matthew Schwartz 發布開源工具包 BootLoops,把 Claude 變成能精確計算的科研工具。他稱適配 LLM 強項的問題為 Claude-shaped,並在地質、生物、經濟、語言學等領域與專家合作取得進展。BootLoops 開源,可搭配任意模型。
論文提出 RLTL;DR:每次嘗試失敗後,把驗證器的輸出展示給策略模型,讓它自己寫一條 TL;DR 式的心得作為反饋,下一次 rollout 以此為條件。該方法針對的是 RLVR 的失效場景——任務難到成功率極低甚至為零,且沒有教師模型或示例解可蒸餾。
社交俱樂部 The Den 開設新地點,用 ChatGPT Work 將助學金申請從 3 天縮至 2 小時、酒牌材料從 4 天縮至 3 小時。
OpenCode 發布 v1.18.34:本地編譯的 macOS 二進位制會被重新簽名,以在 macOS 27+ 上穩定執行;macOS CLI 發布二進位制改用 Developer ID 簽名。模型請求現在會帶上帶名稱空間的 session 與 parent-session 身份頭。
OpenAI DevDay 發布 GPT-6.1 Sol,Computer Use 成本僅為 Astra 的七分之一。Agents API 首次內建 Computer Use,開發者可複用 Codex 與 ChatGPT 的同款能力。同場還推出非同步工具呼叫、WebSockets、UltraFast 推理與 Decisions API,後者目前是 Luna 的封裝。
Google DeepMind 發布 Gemini 4 Argon,正通過 Fairwind Program 向受信任的網路安全防禦者分批開放,尚未向開發者、企業與消費者開放。輸出 token 上限從 64K 提升到業界領先的 100 萬,定價為每百萬輸入 token 2 美元、輸出 10 美元,快取輸入為輸入價的 95% 折扣。它在 DeepSWE v1.1 得 77.9%,在 LVBench 得 91.7%。
Claude Code 發布 v2.1.286:多條權限請求排隊時會顯示 2 of 5 計數,全屏列表的 N more 行支援滑鼠點選跳轉。修復了 claude --resume/--continue 在大批並行工具呼叫後丟失全部輪次、憑據過期時多個程序重複彈出登入瀏覽器等問題。另改進 commit 流程,提交前會先執行名為 verify 的 skill。
面向 AI、機器學習等領域的博士生,每人最高 6 萬美元,申請截止 2026 年 10 月 30 日。
該技術把不可感知水印嵌入蛋白質序列與 3D 結構,實驗證明不影響生物功能,可用於 DNA 合成篩查。
用 Claude 評估的研究顯示,現有機器人能完成美國 74% 的體力工作任務,佔全部工時 34%,但只在 0.3% 的任務上比人工更便宜。若機器人價格按過去趨勢下降,這一比例要 40 年才達到 10%。過去 50 年裡,機器人暴露度高的崗位工資與就業下降更多。
一項系統性研究在注入與移除目標概念兩種場景下比較了多種 LLM 條件控制方法,發現高效的 steering 方法往往以生成流暢度大幅下降為代價。研究指出,此前對這類權衡缺乏清晰理解,而現有方法評估常常只看效果、忽略生成質量。
Anthropic 宣布棄用 Claude Sonnet 4.5(claude-sonnet-4-5-20250929),Claude API 上的退役日期為 2026 年 11 月 30 日,官方建議遷移到 Claude Sonnet 5.5。詳情見 Model deprecations 文件。
該排行榜用可懂度、速度和說話人相似度等客觀指標評測多語言 TTS 與聲音克隆,不替代人類偏好。
Ollama v0.35.0 支援決策模型,經 /v1/systemone 呼叫,返回選擇、機率和分數而非文字。首批可用模型為 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1。支援 choice、noul、score 三種問題型別,適用於工單分類、模型路由和內容分類。
Anthropic Frontier Red Team 在內部 Binary Exploitation 基準隨機抽取的 100 個任務上測試,GLM-5.3 在 4% 的試驗中實現完整控制流劫持,Claude Mythos Preview 為 6%。更早的 Claude Opus 4.6 和 GLM-5.2 則一次都沒成功。
Anthropic 發布 Claude Code v2.1.285,新增 CLAUDE_CODE_DISABLE_WEB_FETCH 環境變數可關閉 WebFetch 工具,claude --desktop 可直接在當前目錄開啟桌面應用,並新增 allowedProviders 設定限制機器可用的 API 供應商。
Simon Willison 在 Hacker News 點評 GPT 6.1 Sol,稱其以約五分之一的價格提供接近 Astra 的智慧。
v0.35.1-rc0 允許在 Modelfile 中宣告 CAPABILITY,並在 create 請求中增加 capabilities 欄位。這些宣告會在 GGUF、safetensors 的建立、繼承與 Modelfile 匯出中保留。排程 System One 請求前須先判定 capability,不再依賴 Qwen 架構與渲染器後設資料匹配;評分仍限 GGUF,MLX 執行時改動另行處理。
作者用 GPT-6 Astra 構建該實驗工具,基於 MediaPipe C++ 編譯的 WebAssembly 與 BlazeFace 模型,在本地識別人臉並自動模糊,同時清除後設資料。
NVIDIA 發布開源表格基礎模型 Kumo Tabular,28M 至 215M 三檔引數,OpenMDW-1.1 許可可商用。它在 TabArena、BeyondArena、TALENT、ScoringBench 四個基準排名第一。給定帶標籤的表格,單次前向即輸出分類機率或迴歸數值,無需訓練、調參和特徵工程。
研究者發布 ProvenanceGuard,一個接在 MCP agent 之後的事後驗證層,逐條判斷答案裡的 claim 是否真由它所指的那個工具來源支援。在醫學 agent 的 361 條 claim 上,專家判定 139 條不應通過,它攔下 138 條,另外把 67 條專家認可的 claim 送去複核或修復。
MLX 發布 v0.32.3,以 bug 修復和 Metal/CUDA 核心最佳化為主。新增 M5 Ultra 非量化 matmul 調優與 Metal gated delta net 核心,並改善 SDPA D256/D512 的 Metal 視訊記憶體佔用。同時修復整數除零崩潰、GGUF 張量維度校驗等問題。
ChatGPT 推出 Pages:可把一段對話直接變成 Page,也能從模板開始或直接在 Space 裡寫。頁面可用 ChatGPT 改寫文字、加圖表或生成互動內容,協作者能共同編輯並留評論,各自用自己的 ChatGPT。Page 沿用 Space 的可見性與分享設定,分享頁面不會讓他人看到你的私人對話或記憶。
Anthropic 啟動新研究,通過 Anthropic Interviewer 收集人們與 AI 的經歷,參與者可自願公開訪談。
GPT-6.1 Sol 已在 Codex 和 ChatGPT 中提供,處理複雜工作的效能接近 Astra,但成本更低。它適合程式碼、應用和文件類反覆、長時間執行的任務,可通過模型名 gpt-6.1-sol 呼叫。具體可用性取決於套餐、客戶端和工作區設定。