OpenAI 發布 372 項數學成果,含 Unique Games 猜想證明
OpenAI 公布 372 項數學與理論電腦科學成果,其中包括 Subhash Khot 的 Unique Games Conjecture(UGC)證明,推薦名單有 Timothy Gowers、Edward Witten 等數學家。UGC 意味著許多最佳化問題即使只想比半正定規劃鬆弛略好地近似,也是 NP-hard。部分成果附 Lean 證書,但幾乎所有證明尚未被人類理解;
依意思最接近的 27 筆
OpenAI 公布 372 項數學與理論電腦科學成果,其中包括 Subhash Khot 的 Unique Games Conjecture(UGC)證明,推薦名單有 Timothy Gowers、Edward Witten 等數學家。UGC 意味著許多最佳化問題即使只想比半正定規劃鬆弛略好地近似,也是 NP-hard。部分成果附 Lean 證書,但幾乎所有證明尚未被人類理解;
OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。
Apple 研究員 awnihannun 在社交平台發布一首短詩,稱因「未來會 foom」而上調自己的 P(doom),即 AI 導致人類滅絕的主觀機率。詩中還提到中文房間、shoggoth 與死神之眼等 AI 圈內梗,未給出具體數值或論證。
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
在 Hacker News 關於 openai/math 的討論中,Jake Boggan 稱自己斷續研究了 24 年的 Barnette 猜想似乎已被證明,編號是 problem 180。他早年沉迷圖論,曾搬到布達佩斯跟隨名家學習,期間開始做這個問題,前後投入數千小時,去年夏天還一度以為是自己解出來的。得知結果後,他說不知道該怎麼想,這種感受像聽說前女友突然死於車禍,並猜當晚不少人心情複雜。
斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。
OpenAI 從 openai/math 倉庫撤回了 3 篇與霍奇猜想相關的數學手稿,起因是第一篇在一處關鍵論證中把幾何操作的符號寫成 +1,按論文自身約定應為 -1,導致本應歸零的計數不為零,另兩篇因沿用該構造被一併撤回。倉庫手稿總數從 722 篇降至 719 篇,同時修訂 14 篇、13 篇更新引用,並新增 6 項 Lean 形式化,目前 300 篇主結果完成形式化,約佔 719 篇的 42%。OpenAI 強調撤回的是證明而非數學命題本身,原稿保留可查;
Fadell 在 MIT Future Fest 上表示,Rabbit R1、Humane Ai Pin 和 Limitless 掛墜這批第一代 AI 硬體失敗,是因為沒有解決任何真實需求,只是對極客有趣的技術。他指出全球不到 0.01% 的人用過人類助理,多數消費者並不知道助理是什麼,建立信任需要數年。
OpenAI 一次性公開 722 篇數學手稿,歸為 372 組結果,全部出自一個尚未發布的內部模型,涉及準黎曼猜想、霍奇猜想、BSD 猜想、π的無理性指數、卡塔蘭常數無理性、唯一遊戲猜想等。據 OpenAI 介紹,模型共嘗試約 4000 個研究問題,平均每項結果消耗算力約相當於 ChatGPT Pro 思考 3 小時;論文、原始碼與部分 Lean 證明已上傳 GitHub。倉庫註明各手稿核驗進度不一,部分成果尚無 Lean 形式化證明。
技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。
《大西洋月刊》播客《The Permanent Questions》10 月 4 日發布一期對談,社會心理學家、《焦慮的一代》作者 Jonathan Haidt 在與 David Brooks 的對話中稱 AI 是「教育的中子彈」。該期節目在上月 Atlantic Festival 現場錄製,全長約 40 分鐘,話題還包括情緒在道德決策中的作用、如何設計出更少令人厭惡的精英階層等。影片發布於 The Atlantic 的 YouTube 頻道,目前約 2.8 萬次觀看。
The Verge 發表評論文章,認為人類的心智並不適合應對 AI,AI 行業把大腦等同於計算機的流行比喻過於簡化了人。文章引用控制論奠基人 Norbert Wiener 的「每個時代的思想都映照在其技術中」,並點名 Google 的 Demis Hassabis 稱大腦是圖靈機的生物近似、Elon Musk 稱應把大腦視為生物計算機。作者反駁這類說法,指出人類的複雜性遠超多數 AI 從業者的認知,而 AI 產品仍在不斷推進。完整內容見 The Verge。
OpenAI 開發者帳號 @OpenAIDevs 發布推文,展示一個 one-shot(單次生成)做出的冰球遊戲,正文只有「A one-shotted hockey game」一句。原帖未說明所用模型、提示詞、可執行地址或開放範圍,也沒有附帶更多引數與說明。發布時間為 2026 年 10 月 7 日。
OpenAI 把一個尚未發布的內部模型產出的 722 篇數學手稿一次性放上 GitHub,歸入 372 個「成果族」,覆蓋數論、幾何、理論計算機、數學物理等 17 個方向。清單裡既有證明也有證偽,摘要中出現「證偽」「反例」的成果族約 50 個;約六成附有 Lean 形式化,其餘只能算聲稱,且絕大多數尚未經過同行評審。涉及的包括準黎曼猜想、BSD 公式、有理數域上的希爾伯特第十問題、唯一遊戲猜想、Hadwiger 猜想反例、埃爾德什等差數列猜想等。
Google DeepMind、Meta 與 AI 製藥公司 Isomorphic Labs 共同出資 3 億美元,投入由扎克伯格夫婦創立的非營利生物醫學機構 Biohub 牽頭的“虛擬細胞”專案。該專案屬於總額 18 億美元的“Virtual Biology”計劃,目標是建置可供 AI 使用的生物資料集與高精度預測模型,讓研究者能以數字化方式提出、預測並回答生物學問題,用於對抗疾病。Biohub 成立於 2016 年,長期以預測模型推動疾病防治研究。
AI Impacts 於 2024 年 12 月調查 1,580 名頂會 AI 研究者,他們對「未來 AI 導致人類滅絕或永久喪失自主」的機率中位數首次升至 10%,高於一年前的 5%。同一調查中「極度糟糕(如人類滅絕)」的中位數仍為 5%,自 2016 年以來未變,而人類水平 AI 出現的中位年份從 2016 年的 2061 年提前到 2042 年。
Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。
過去一年,OpenAI、Anthropic 等實驗室宣布解決了多個長期懸而未決的數學問題,其中甚至包括一道千禧年大獎難題,進展超出研究人員預期。但這些實驗室以矽谷式的高速推進,本應被慶祝的成果反而招致學界反彈,有數學家要求 OpenAI 證明未使用其工作成果,也有批評指向其行事方式。實驗室表示正在從早期的失誤中學習,承諾能否兌現尚待觀察。
數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。
Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放形式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時不拖慢關鍵研究進度。官方未披露具體工具名稱、技術細節與適用限制。
OpenAI 在 GitHub 倉庫 openai/math 公開 722 篇數學手稿,歸入 372 個成果族,全部由一個尚未發布的內部前沿模型產出。據 OpenAI 說明,模型被投餵約 4000 個研究問題,平均每個結果消耗約相當於 3 小時 ChatGPT Pro 思考的算力,手稿日期幾乎集中在 9 月 23 日至 10 月 5 日。372 族中有 235 族附帶 Lean 形式化,約佔六成三;OpenAI 承認未形式化的結果可能存在問題,且未公布模型名稱。
Google Labs 推出 AI 遊戲創作平台 Playground,用文字提示就能生成可在瀏覽器執行的遊戲,無需程式設計能力。使用者可選擇問答、競速等型別,指定 2D 或 3D、單人或多人玩法,還能上傳圖片讓 AI 轉成符合美術風格的遊戲資產;成品支援手機與電腦遊玩、連結分享或發布到 Explore 畫廊,並可持續修改。
微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。
Hark 正式發布 AI 個人助理 Hark Pro,可免費使用,重度使用者另有訂閱檔。其底層是專門為操作電腦訓練的模型,能接入信箱、日曆、硬碟與信用卡等,替使用者完成數字任務;介面為全屏,中央是對話方塊,另有 prompt 資訊流與可定製 panels 小儀表盤。演示中它主動提醒待批費用、待回郵件與會議,並提議代訂機票,還曾替人完成加州 DMV 的車輛註冊續期,且會在小視窗展示瀏覽網頁的過程以建立信任。公司計劃 2027 年推出配套的 AI 原生硬體。
AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。
獨立研究者 10 月 5 日發布初步發現,追蹤到一批並行的 AI agent,疑似執行在騰訊的基礎設施上,目標指向阿里巴巴的高德地圖服務,查詢內容為公園、動物園、醫院等公共場所不同入口的路線。研究者拒絕使用 swarm 一詞,稱應叫 agent fleet:多個 agent 執行同類任務,彼此之間沒有通訊跡象。這些活動是通過監控域名掃描服務 URLquery 的流量發現的,該服務常被 agent 用來載入無法直接訪問的網站並留下記錄;研究仍在進行中。