日報 週報 月報 AISpot 日報:2026年10月9日週五
Claude Haiku 5.5 上線,輸入價較上代降 90%;Docs、Slides、Design 三項功能結束 beta,Free 套餐亦可使用。OpenAI 的 GPT-6.1 Sol 新增 Ultrafast 模式,速度快 8 倍,API 定價為標準版 6 倍。Google 同時推出辦公智慧體 Gemini Agent,可在 Gemini 與 Claude 間動態路由。
訂閱動態
機器之心● 精選 AI 評分91
Anthropic 於 10 月 7 日發布 Claude Haiku 5.5,百萬輸入 Token 最低 0.1 美元,較上代降價 90%,並首次在 Haiku 系列引入可調節推理強度,支援 100 萬 Token 上下文與 12.8 萬 Token 輸出。官方基準顯示其在 OSWorld 2.1 取得 72.4% 成功率,高於 GPT-6 Luna 的 48.9%,但最高成績對應最大推理強度,中等強度下 Terminal-Bench 成績從 39.2% 降至約 20%。
推薦理由:官方確認 Haiku 5.5 降價 90% 並首次引入推理強度調節,同時給出與 GPT-6 Luna 的基準對比及新 Tokenizer 帶來的成本差異,對高頻呼叫小模型的開發者和 Agent 成本核算最有用。
機器之心● 精選 AI 評分89
OpenAI 發布 GPT-6.1 Sol 的 Ultrafast 模式,官方稱智慧水平與標準版一致、仍逼近旗艦 Astra,但速度是標準版的 8 倍。其 API 定價為每百萬輸入 token 12 美元、輸出 60 美元,是標準版(2 美元 / 10 美元)的 6 倍,API 呼叫不受訂閱等級限制。
推薦理由:這是 OpenAI 在 Ultrafast 概念上的第二次迭代,把 8 倍加速放到了能力更強的 6.1 Sol 基線上,同時首次將使用門檻抬到 Pro 500 訂閱檔,對做即時智慧體與按量呼叫 API 的開發者最有用。
Claude blog● 精選 AI 評分85
Claude 上線兩項 beta 功能:Dashboards 連線 BigQuery、Snowflake、Salesforce 等資料來源,用自然語言生成並隨資料自動更新的儀表盤,每張圖表可檢視背後的查詢;Motion 把提示詞變成由程式碼驅動的動畫講解,可匯出 MP4,不用影片生成模型。Dashboards 面向付費方案,Motion 僅限 Team 與 Enterprise。
推薦理由:Claude 把 BI 式儀表盤和動畫講解做進對話,官方說明動畫由程式碼生成、不含 AI 生成畫面,並給出 Design 獨立站 12 月 14 日關閉的遷移時間表,對使用這些功能的團隊最有參考價值。
模型
量子位● 精選 AI 評分78
星動紀元自研世界動作模型 VPP2 登頂 RoboDojo 模擬榜單,平均成功率 32.26%、平均得分 39.26 分雙第一,高於 GPT-6-Astra 的 22.48% 和 28.97 分,泛化、精細操作、記憶三項同樣居首。真機 ALOHA 雙臂零樣本 10 類任務平均成功率 58.5%,9 類最佳,高於π0.5 的 40%。該模型未使用額外資料或 Agent RSI 等增強手段,靠三階段訓練解耦影片預測與動作學習,程式碼與專案主頁已開源。
推薦理由:以標準資料集在 42 項雙臂任務的評測中壓過 GPT-6-Astra 與輝達 GR00T,14B 引數反超 64B 基線,並給出真機零樣本與開原始碼,可供具身智慧研究者復現驗證。
Hugging Face blog● 精選 AI 評分78
Hugging Face 的 yuvraj sharma 用 HuggingChat 裡的 ML Intern agent,幾天內做出 6 個公開模型,其中把 Qwen-Image 2.1 自帶的 9B 提示改寫器蒸餾成 0.8B 版本,可在 CPU 執行,輸出有效率 99.7%,token 消耗約為教師模型的四分之一。該專案含 9B 模型標註 8,797 條樣本,算力成本 16 美元。
推薦理由:給出了用通用 agent 從零產出可發布模型的完整賬單:9B 教師蒸餾到 CPU 可跑的 0.8B、單項成本僅幾美元,對做小模型蒸餾和在本地跑模型的人有直接參考價值。
量子位● 精選 AI 評分71
生數科技開放 Vidu Q4 預覽版,720P 圖生影片起步價 0.09 元/秒,實測用 5.4 元做出一分鐘 GTA 6 風格的《邪惡老奶》短片。該版本最高支援 4K 直出,單條最長 16 秒,支援 FPV 視角,一次最多可用 15 張參考圖和 3 段參考音訊,官方稱強化了表情情緒、運鏡與特效對環境的真實影響。價格與規格掛鉤:MaaS 端 720P 約 0.6 元/秒、1080P 約 0.75 元/秒,SaaS 端預覽版提供兩個月限時優惠,部分使用成本可降至每秒幾分錢。
推薦理由:生數科技首次放出 Q4 旗艦模型的預覽版,並給出 0.09 元/秒的 720P 起步價、4K 直出與 15 張參考圖等具體規格,對關心 AI 影片生成成本與可用邊界的創作者有參考價值。
產品與方案
量子位● 精選 AI 評分86
Google 發布通用辦公智慧體 Gemini Agent,可長期雲端執行,自己查資料、寫郵件、做 PPT、分析資料並跨應用規劃任務。它擁有獨立企業身份,配專屬 Workspace 帳號、信箱、日曆和 Drive 空間,可被同事拉進群聊或在文件中 @。底層支援多模型編排與 Smart Routing,能在 Gemini 與 Anthropic 的 Claude 之間按效果、速度和成本動態選擇,未來計劃支援更多閉源與開源模型。
推薦理由:Google 官方確認辦公 Agent 的底層模型可動態選用競品 Claude,並給出獨立企業身份與四種記憶機制,對關注企業級 Agent 與多模型排程的團隊有參考價值。
Anthropic Research● 精選 AI 評分85
Anthropic 上線 OSS Scanner,面向開源專案免費提供由最強模型(含 Claude Mythos)生成的定期漏洞掃描,報告全自動生成、不經人工稽核,因此可能存在無效結果。過去六個月其模型在重要開源專案中找出逾 29,000 個候選漏洞,人工僅複核約 6,000 個,另有近 5,000 份未驗證報告應維護者要求直接提交。內部以 97 個高危漏洞驗證早期版本,其中 85 個(88%)達到其漏洞披露標準,僅 1 個誤報。
推薦理由:Anthropic 首次把最強模型用於開源漏洞掃描並免費開放,給出 88% 有效率、2.9 萬條候選漏洞等實測數字,開源維護者可據此提前拿到帶復現與補丁的報告。
X @claudeai● 精選 AI 評分80
Claude 的 Docs、Slides、Design 三項功能結束 beta 測試,即日起在包括 Free 在內的所有訂閱套餐上線,不再限於付費使用者。三項分別對應文件、簡報與設計稿,團隊和 Claude 可以同時編輯同一份檔案,屬於人機共編的協作方式。公告由 Claude 官方帳號發布,此次變化的核心是走出測試階段並覆蓋全部套餐。
推薦理由:官方確認三項文件協作功能結束 beta 並覆蓋含 Free 的全部套餐,團隊與 Claude 可在同一份文件、簡報和設計稿上共同編輯,關注 Claude 協作能力與免費版功能範圍的人值得一看。
Ars Technica AI● 精選 AI 評分80
微軟在兩年來的首場線下活動中發布 Surface Laptop Ultra,這是首款搭載 Nvidia RTX Spark SoC 的裝置,起售價 2599 美元,10 月 16 日開始發貨,現已開啟預售。它可選 5120 核或 6144 核 Blackwell GPU,統一記憶體最高 128GB LPDDR5x,依靠統一記憶體分配而非傳統視訊記憶體上限,兼顧本地 AI 開發部署與 3A 遊戲執行。
推薦理由:官方首次給出 RTX Spark 筆記本的完整配置、2599 美元起售價與 10 月 16 日發貨時間,為評估本地 AI 開發硬體的開發者提供了具體的規格與價格參照。
TechCrunch AI● 精選 AI 評分78
Google 發布 Google AI Edge Foresight,一款可在 Mac 上完全離線執行的 AI 會議筆記應用,對標 Granola。它用端側 7.4 億引數的 EmbeddingGemma 2 記錄跨應用及線下會議,採用分屏佈局:一側手寫速記、一側生成 AI 筆記,可檢視轉錄原文,或與 Gemma 4 驅動的助手對話。使用者還能上傳 PDF、Google Docs、Office 文件、純文字、Markdown 與網頁書籤搭建知識庫,會議中即時回答相關問題。
推薦理由:Google 把 Gemma 系列端側模型落成完整本地會議筆記產品,7.4 億引數 EmbeddingGemma 2 加 Gemma 4 助手全程離線,對關注本地推理與會議記錄工具的人有參考價值。
The Verge AI● 精選 AI 評分78
Meta 的 Muse 與 OpenAI 的 Dots 相繼發布,把常駐式自主 AI agent 推向普通消費者,Muse 免費而 Dots 收費。兩者都以卡通吉祥物形象包裝,能代訂餐廳、機票、買禮物、整理收件箱,OpenAI 還推出面向營銷、法律與會計的專家版 Dots。此前個人專案 OpenClaw 已帶動 Mac Mini 銷量上漲,而把信用卡、信箱等敏感資料交給 agent 的隱私與安全代價仍未有解。
推薦理由:兩大廠首次以免費與訂閱兩條路線正面競逐常駐自主 agent,並直麵包辦訂票、收件箱等真實任務後的隱私代價,對關注 AI 助手形態與訂閱方案的人有參考價值。
機器之心● 精選 AI 評分77
豆包工作新增創作畫布功能,並接入輕量級模型豆包 2.1 Lite。畫布把素材、設計方案與創作成果集中在同一張無限畫布上,圖片生成後仍可繼續修改文字、配色和佈局,同時接入全新圖片模型 Seedream 5.0 Flash,Agent 可覆蓋從理解需求到生成圖片、影片和成套設計。豆包 2.1 Lite 面向日常問答、文件撰寫、表格處理與 PPT 製作,在回應速度與額度消耗上做了最佳化,客戶端升級後選擇該模型即可使用。
推薦理由:豆包工作把素材、方案與成圖收進一張無限畫布,並接入 Seedream 5.0 Flash 與主打低額度消耗的豆包 2.1 Lite,對高頻做創意設計和文件辦公的人有直接參考價值。
開發工具
Hacker News front page● 精選 AI 評分80
開發者用一句提示讓 Claude Opus 5.5 在 Claude Code 裡以 three.js 製作卡爾維諾《看不見的城市》全部城市的互動視覺化,實際耗時 1 小時 25 分,由 6 個子代理並行完成,API 花費約 74 美元,成品被作者形容為令人著迷。同一提示交給 Codex 中的 GPT-6 Astra,53 分鐘、中等推理強度、約 10 美元即可端到端跑通,但混入了多餘概念與冗餘說明文字。
推薦理由:給出同一句提示下 Opus 5.5 與 GPT-6 Astra 的實測對比,含耗時、並行子代理數、API 花費與成品品質差異,對關心 coding agent 前端與互動設計能力的讀者有直接參考價值。
claude.dev blog● 精選 AI 評分74
Anthropic 發布基於 Claude Managed Agents(beta)的 agent 自動化參考實現:按 cron 計劃讀取 Slack 頻道與 GitHub PR,依據上次執行留下的書籤只取新增內容,再把簡報發到指定 Slack 頻道。配套程式碼含 agent、部署、環境、記憶與 vault 等配置,用 ant apply 寫入 Claude API 工作區,憑據存於 vault、沙箱內只留佔位符;
推薦理由:官方給出可直接跑的參考實現與配置命令,把書籤式增量讀取、憑據隔離與資料來源失敗上報這些易踩坑處都寫成了明確規則,適合用 Claude 搭定時簡報類自動化的開發者。
Claude blog● 精選 AI 評分63
Square 與 Cash App 母公司 Block 的 AI 負責人 Bradley Axen 介紹了用 Claude Fable 5 編排大規模程式碼遷移的做法:單次遷移涉及跨倉庫的數百到數千個 PR、數百萬行程式碼,由 Fable 負責資料模型、API 規格等高層設計,再排程數十個 Opus、Sonnet 等更便宜的模型完成具體檔案修改與測試,全程跑在其開源協作工作區 Buzz 上。早期結果顯示前沿 token 集中在前期規劃、執行更多交給小模型,品質沒有下降。
推薦理由:Block 高管稱這是用 LLM 寫程式碼以來首次不再預設 100% 用最強模型,並給出數千 PR 遷移中前沿模型編排、小模型執行的具體分工,對做大規模重構與 agent 編排的團隊有參考價值。
OpenAI Codex CLI releases● 精選 AI 評分60
OpenAI Codex CLI 發布 0.162.0,啟用 worktree 功能後可從受信任的本地專案建立並列出託管 Git worktree。TUI 新增 /copy 跳轉與複製對話塊、Ctrl+Insert 複製選區,滾輪速度由 tui.mouse_scroll_speed 調整;自訂 Responses 相容模型提供方可配置即時聯網與遠端壓縮,Code Mode 增加流式 Promise 輔助與可選排序工具搜尋。
推薦理由:託管 Git worktree 讓多個 Codex 會話在隔離工作樹中並行改動,TUI 複製、沙箱與 Windows 檔案訪問修復直接影響日常使用,適合 Codex CLI 使用者與在本地跑 coding agent 的人。
地端推論
llama.cpp releases● 精選 AI 評分74
llama.cpp 的 CUDA 後端重做 top-k 演算法選擇,大行數場景改用按行網格的 radix select 替代 CUB 逐行 DeviceTopKKernel,在 qwen4exp 34,816 tokens 上啟動次數從 1,671,253 次降到 2,329 次,耗時從 5,761.8 ms 降到 941.8 ms。
推薦理由:CUDA 上 top-k 從 167 萬次 kernel 啟動降到 2,329 次、耗時由 5,761.8 ms 降至 941.8 ms,是官方合併的具體實測數字,對在 NVIDIA 顯示卡上用 llama.cpp 跑長上下文推理與取樣的使用者最直接。
llama.cpp releases● 精選 AI 評分69
llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。
推薦理由:MoE 快取跨多 GPU 是本地跑大引數 MoE 模型時的關鍵最佳化,直接關係到多卡推理能否跑起來,對用 llama.cpp 在消費級多卡上部署的使用者有參考價值。
Google Developers blog● 精選 AI 評分68
Google AI Edge 推出 ML Drift,一個面向端側 AI 與機器學習推理的高效能通用 GPU 計算框架。它把 OpenGL ES、OpenCL、Metal、WebGPU 等底層硬體與圖形計算 API 抽象掉,讓開發者無需直接處理這些介面,就能在移動端與桌面端建置即時互動式 ML 體驗,覆蓋從複雜影片特效到生成式 AI 的場景。
推薦理由:Google 官方給出跨 OpenGL ES、OpenCL、Metal、WebGPU 的統一 GPU 推理抽象,為在移動與桌面端做即時影片特效與生成式 AI 的開發者提供了端側部署的新選項。
Ollama releases● 精選 AI 評分68
Ollama v0.40.2 起,此前版本下載的模型會在首次執行時自動在後臺升級,以提升效能與 llama.cpp 相容性。升級會保留原模型作為備份,因此已升級的模型會暫時多佔用磁碟空間,官方表示未來版本會自動清理。需要現在清理可執行文件給出的 jq 指令碼配合 ollama rm 刪除,但這隻刪除備份,日後若要降級到 0.40 以前的版本,需重新拉取這些模型。
推薦理由:官方首次說明舊模型會自動升級到 llama.cpp 執行器、備份會額外佔盤,並給出精確的清理命令與降級需重拉的代價,便於本地部署 Ollama 的使用者決定是否清理備份。
研究
機器之心● 精選 AI 評分83
由德州農工大學、Google DeepMind、CMU 等 15 家機構聯合發布的 TouchScale 資料集公開,500 小時人類第一視角視覺-觸覺資料由同一套穿戴裝置採集,雙手各含 880 個觸覺感測器單元。僅用這批資料做 mid-training,xArm6 機械臂加 BrainCo Revo 2 靈巧手在四項接觸密集型任務上的平均成功率從 22.5% 升到 57.5%;
推薦理由:把人類視觸覺資料在統一感測器與採集流程下擴到 500 小時,並給出真機成功率從 22.5% 升至 57.5% 及隨規模增長的實測曲線,對做具身智慧與機器人操作的人最有用。
量子位● 精選 AI 評分81
UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。
推薦理由:首次把 AI 跨學科端到端復現論文的能力量化為 13.98%,並公開可重跑、只認重放證據的評測協議與 12 個開源任務,對做 AI4S 和 Agent 評測的人有直接參考價值。
機器之心● 精選 AI 評分78
VideoGen-Agent 用 Qwen3-VL-8B-Instruct 做基座,在多輪互動中呼叫檢索、生成與驗證工具,先以 16K 教師軌跡監督微調,再用 8K 提示做多工強化學習。在 600 條提示的 VABench 上,Toolset 1 配置得 75.6 分,比基礎生成器 56.5 分高出 19.1 分;智慧體策略不變、僅升級生成工具後達 86.1 分,人類評估中 84.3% 的判斷偏好該配置。
推薦理由:論文給出影片生成智慧體的可訓練方案與 VABench 基準,並驗證策略無需重訓即可隨底層生成工具升級而漲分,對關注多模態 agent 與影片生成的人有參考價值。
機器之心● 精選 AI 評分78
斯坦福李飛飛、吳佳俊等團隊發布開源世界動作模型框架 OpenWAM,用共享底座加可切換的互動方式,回答 WAM 裡究竟是哪個設計帶來提升。框架基於阿里 Wan2.2-5B,先在約 334 萬條、約 1.46 萬小時機器人影片上做因果化預訓練,再用 MoT 拼起 5B 影片專家與 2B 動作專家,支援四種先想或先動的互動程式。因果底座把 LIBERO-Long 成功率從 68.4% 拉到 97.8%,配反事實資料的區域性 IDM 遷移到新任務平均達 84.0%。
推薦理由:用固定底座、只改一個變數的方式拆解世界動作模型,並給出因果化預訓練與反事實資料的量化增益,對研究機器人學習、想把影片模型當大腦底座的人有用。
Hacker News front page● 精選 AI 評分77
AI Impacts 於 2024 年 12 月調查 1,580 名頂會 AI 研究者,他們對「未來 AI 導致人類滅絕或永久喪失自主」的機率中位數首次升至 10%,高於一年前的 5%。同一調查中「極度糟糕(如人類滅絕)」的中位數仍為 5%,自 2016 年以來未變,而人類水平 AI 出現的中位年份從 2016 年的 2061 年提前到 2042 年。
推薦理由:把 AI 研究者、超級預測者與公眾對 AI 滅絕風險的最新估計並排對比,研究者中位數首次升到 10%、時間預期提前近二十年,對關注 AI 安全與政策討論的讀者有參考價值。
機器之心● 精選 AI 評分76
2026 年 9 月 14 日《Nature》發表 5 家藥企合作研究:用超過 2 萬份未公開的蛋白質—小分子結構資料,以聯邦訓練改進 OpenFold3。在 1056 個留出結構測試中,新模型高精度預測超過一半,公開版 OpenFold3 約三分之一,兩項關鍵指標分別提升約 10% 和 11%。參與方為 AbbVie、Astex、BMS、強生與武田,資料無需外流;英國 OpenBind 專案獲最高 800 萬英鎊支援,計劃 5 年內建開放資料庫。
推薦理由:AISB Network 首個專案顯示,藥企私有結構資料不出企業即可聯邦訓練,蛋白質—藥物相互作用預測準確率提升約 10%,為資料受限的結構模型指出可行路徑。
Hacker News front page● 精選 AI 評分76
LittleBit 專案放出論文官方實現,可把 LLM 權重壓縮到 1.0 至 0.1 bits-per-weight,推理時保持原模型結構不變。ICML 2026 的 LittleBit-2 新增 Joint-ITQ 初始化,通過 --use_itq 開啟,只改初始化、不增加推理開銷,並支援 SmoothSign 量化感知訓練與可選殘差分解。
推薦理由:論文官方實現開源,把 LLM 權重壓到 0.1 bit 仍保持原架構推理,並新增只改初始化、無推理開銷的 Joint-ITQ 開關,對做極低位元量化和本地部署大模型的人有直接參考價值。
Anthropic Research● 精選 AI 評分75
Anthropic 研究員、約翰斯·霍普金斯大學天體物理學家 Brice Ménard 用 Claude Science 製作出首張完整的紫外(UV)全天圖,其中約三分之一天空、包括銀河系盤面的大部分,由模型預測填補。此前 NASA 的 GALEX 在 2003 至 2013 年以約 3.8 萬次觀測覆蓋約三分之二天空,但為保護探測器跳過了亮星密集區,其他望遠鏡的資料也留有缺口。
推薦理由:首張完整紫外全天圖由 Claude Science 的 agent 團隊完成資料合併與三分之一天空的預測填補,並給出畫素級實測/預測標註與不確定度,對天文教育和關注 AI agent 承接科研流程的人有參考價值。
機器之心● 精選 AI 評分75
Einsia AI 旗下 Navers Lab 發布 World Models' Last Exam in Physics,用 40 個任務、9 類物理現象測試 8 個影片生成模型,Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。評分由一致性分 C 與物理分 P 組成,物理分靠程式從影片中測量軌跡、週期、角度等量再按物理關係計算,且只有 C≥80 才計入總分。
推薦理由:提供可公開復現的物理能力基準:40 個任務覆蓋 9 類物理現象,物理分由程式實測軌跡、週期、角度等物理量得出,對關心世界模型與影片生成落地(如機器人預演)的讀者有參考價值。
機器之心● 精選 AI 評分74
OpenAI 從 openai/math 倉庫撤回了 3 篇與霍奇猜想相關的數學手稿,起因是第一篇在一處關鍵論證中把幾何操作的符號寫成 +1,按論文自身約定應為 -1,導致本應歸零的計數不為零,另兩篇因沿用該構造被一併撤回。倉庫手稿總數從 722 篇降至 719 篇,同時修訂 14 篇、13 篇更新引用,並新增 6 項 Lean 形式化,目前 300 篇主結果完成形式化,約佔 719 篇的 42%。OpenAI 強調撤回的是證明而非數學命題本身,原稿保留可查;
推薦理由:首份官方勘誤披露 722 篇手稿公開兩天即撤回 3 篇、修訂 14 篇,並給出 42% 主結果形式化率,關注 AI 生成數學證明可信度的人可據此判斷其實際把關程度。
量子位● 精選 AI 評分72
MirroS 團隊發布 AgentGarten,把可執行程式碼環境與即時神經渲染器接成閉環:物理規則由程式碼裁定,畫面由模型以 480p、30fps 以上流式逐塊生成,智慧體因此能邊行動邊看結果。重做的捉迷藏實驗中,躲藏者第 4 輪學會搬擋板搭掩體、搜尋者第 10 輪學會借坡道翻牆,而 OpenAI 2019 年的自我博弈強化學習分別用了約 2500 萬局和 1 億局。智慧體靠每輪復盤寫下文字「實驗手冊」傳給下一輪,另在陪伴小狗、狹橋會車、合作牧羊、採石場裝載機四個任務中各跑四輪;程式碼已在 GitHub 開源。
推薦理由:給出可執行程式碼世界與即時神經渲染耦合的具體做法與實測資料:數輪內復現捉迷藏策略,對照 2019 年數千萬至上億局自我博弈,對做具身智慧與世界模型的研究者最有用。
Latent Space● 精選 AI 評分69
Periodic Labs 聯合創始人 Liam Fedus 與 Ekin Dogus Cubuk 在一檔播客中介紹了其「合成超級智慧」構想:以真實物理實驗作為強化學習環境,訓練能自主發現新材料的 AI 科學家。這家成立一年的公司正搭建自動化實驗室,希望讓每臺儀器擁有「140 IQ」,並用做科學的完整過程而非僅論文結果來訓練模型。他們認為失敗的實驗可能是最有價值的訓練資料,自主實驗可把數十年的試錯壓縮到數月,目標材料涵蓋室溫超導、磁體與電池。
推薦理由:創辦團隊參與過 ChatGPT、GNoME、MatterGen 的 Periodic Labs 詳細闡述「合成超級智慧」路線:讓每臺實驗室儀器具備「140 IQ」、用負結果與實驗過程訓練模型,對關注 AI for Science 與材料發現的人有參考價值。
機器之心● 精選 AI 評分68
香港科技大學、香港城市大學、復旦、CMU、NYU、NTU 等機構聯合發布 110 頁綜述《The Past Frames the Future: Memory for Autoregressive Video Generation》,系統梳理自迴歸影片生成中的 Memory 機制。
推薦理由:首篇系統梳理自迴歸影片生成 Memory 的綜述,用四類載體、五類功能與生命週期五操作統一分類,並指出長期一致不等於真正用上記憶,適合做長影片生成與世界模型的研究者與開發者。
Apple Machine Learning Research● 精選 AI 評分65
論文提出 Normalizing Trajectory Models(NTM),把擴散模型的每個反向步建模為表達力強的條件歸一化流,並支援精確似然訓練。擴散取樣通常依賴大量細小的高斯去噪步,壓縮到少數粗粒度轉移時該假設不再成立;此前的少步方法用蒸餾、一致性訓練或對抗目標解決,但都放棄了似然框架。架構上,NTM 在每步內組合淺層可逆塊與深層並行結構。
推薦理由:提出一種在少步生成下仍保留精確似然訓練的新建模方式,把擴散的每一步換成條件歸一化流,對研究少步取樣與似然建模的人有參考價值。
政策與安全
TechCrunch AI● 精選 AI 評分85
三名上週被 OpenAI 解僱的安全研究員 Jasmine Wang、Tomek Korbak、Mikita Balesni 發表公開信,否認公司關於他們違規處理敏感資訊的指控,並警告此次解僱正在內部造成寒蟬效應。信中稱,安全人員依賴與外部專家的密切合作來識別風險,如今員工不清楚行為邊界,上月還屬正常的行為可能突然成為解僱理由。OpenAI 以一份內部備忘錄回應,稱解僱與提出安全擔憂無關,並表示認同研究人員提出的引入第三方安全審計等建議。
推薦理由:三名被解僱研究員首次公開回應違規指控,並給出 OpenAI 內部備忘錄的否認說法與 Wang 對解僱理由的具體描述,關注 AI 安全治理與 OpenAI 內部文化者可據此對照雙方說法。
Anthropic News● 精選 AI 評分80
Anthropic 於 10 月 8 日啟動長期安全計劃 Anthropic Cyber Mission,首批聚焦關鍵基礎設施與開源軟體兩個方向。關鍵基礎設施防禦計劃(CIDP)向受信任的供應商提供前沿 Claude 模型、駐場工程師與威脅研究,創始夥伴包括 CrowdStrike、Dragos、Palo Alto Networks、羅克韋爾自動化等 11 家。同期推出 OSS Scanner,用其最強模型為開源專案提供免費的定期安全掃描。
推薦理由:官方首次把前沿模型、駐場工程師與威脅研究打包投向電網、水務等運營技術防禦,並免費為開源專案做安全掃描,對關鍵基礎設施安全團隊與開源維護者最有用。
OpenAI News● 精選 AI 評分75
OpenAI 宣布封禁來自俄羅斯和伊朗的各一個隱蔽影響力行動,它們把其模型與傳統手段結合,經營「假媒體」實體來洗白地緣政治資訊。伊朗方面運營 7 個「記者」人設,向全球中小媒體投遞長文;俄方在拉美借不知情者開設「智庫」,並偽造洩露檔案與音訊指令碼,兩者還大量用 AI 起草內部報告以誇大成效。按 IO Breakout Scale 評估,俄方行動達到第 5 級,是 OpenAI 開始披露以來搗毀的首個第 5 級行動,伊朗行動為第 4 級。
推薦理由:首次公開確認第 5 級影響力行動,並說明 AI 讓假媒體在規模、語言流暢度與編輯能力上提速,對內容安全、平台治理與事實核查從業者最有參考價值。
Anthropic News● 精選 AI 評分68
Anthropic 發布 2026 版 Usage Policy,11 月 12 日生效,多數改動是把既有規則寫得更明確。新版把原本分散在選舉、欺詐、隱私等章節的規則合併為禁止欺騙性活動或人為造勢,選舉章節更名並聚焦禁止欺騙選民,同時取消對個性化投票與競選定向的一刀切禁令。武器禁令明確覆蓋武器制導與控制軟體、武裝無人機等;監控條款寫明未經同意追蹤他人(含分析既有資料)被禁,但欺詐監測、內容稽核、新聞與法律研究仍可用。
推薦理由:官方確認政策邊界與執行口徑,首次合併欺騙性活動條款、補充自主物理動作硬體要求,對用 Claude 做產品、涉及選舉、監控或高風險場景的開發者最有用。
商業
X @AnthropicAI● 精選 AI 評分65
Anthropic 宣布向 Genesis Mission 承諾投入 1.5 億美元,以深化對科學研究與技術發現的支援,這是本次公告的核心內容。同時,Anthropic 將把 Claude 及其技術支援開放給超過 15 家聯邦機構。訊息由 Anthropic 官方帳號於 2026 年 10 月 8 日發布,公告未披露資金的具體用途與投放週期,也未列出參與合作的聯邦機構名單。
推薦理由:官方公告給出了 1.5 億美元的具體投入金額,並明確 Claude 及技術支援覆蓋超過 15 家聯邦機構,對關注 AI 公司科研資助與政府合作動向的讀者有參考價值。
量子位● 精選 AI 評分65
Manus 母公司蝴蝶效應完成超 5 億美元新一輪融資,由博裕投資、IDG 資本領投,騰訊、紅杉中國、真格基金繼續加持,同時重啟北京辦公室、組建面向中國市場的 AI Agent 產品團隊。招聘官網顯示目前開放 17 個崗位(16 個全職、1 個實習),較國慶假期前的 11 個明顯擴大,含 AI Agent 產品經理、Agent Harness 工程師、Agent 評測工程師、LLM 演算法工程師等核心崗。
推薦理由:披露了 Manus 被中方資本回購、恢復獨立運營後的首次本土化編制:5 億美元融資與 17 個崗位的具體數字,讓關注 Agent 賽道格局和國內 AI 人才爭奪的讀者看到這家昔日頂流的迴歸路徑。