論文:Lean 驗證 AI 形式化證明不等於原證明正確
arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。
依意思最接近的 30 筆
arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。
Fadell 在 MIT Future Fest 上表示,Rabbit R1、Humane Ai Pin 和 Limitless 掛墜這批第一代 AI 硬體失敗,是因為沒有解決任何真實需求,只是對極客有趣的技術。他指出全球不到 0.01% 的人用過人類助理,多數消費者並不知道助理是什麼,建立信任需要數年。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。
TypeSafe AI 宣布完成 8.7 億美元 A 輪融資,估值達 75 億美元,由 Andreessen Horowitz 領投,Sequoia Capital、現有投資方 DCVC 及多位天使投資人參與,a16z 的 Martin Casado 加入董事會。公司表示將把 Jev 的能力擴充套件到更多 machine-native 模型,並補齊企業客戶要求的功能。目前財富 500 強中已有三分之一在使用 Jev,公司稱已在生產環境為客戶節省數百萬美元。
陶哲軒在加州理工學院發表《Math 2.0》演講,認為數學正從「證明稀缺」轉向「證明富足」:只要有算力和前沿模型,過去需要數年甚至數十年才能解決的開放問題可能很快就有答案。他同時警告,只最佳化 AI 解題已在損害數學長期健康,因為答案可能繞過人類理解直接產生。他主張 Math 2.0 應把 AI 嵌入人類理解與數學研究的各環節,並舉例等式理論專案判定超 2200 萬個命題、逆伽羅瓦問題挑戰從 24 次擴充套件到 31 次。
數學形式化正從人工轉錄轉為 AI 自動形式化:Anthropic 於 2026 年 9 月 4 日宣布完成費馬大定理的自動形式化,11 天生成 1300 萬行 Lean 程式碼;OpenAI 9 月 8 日公布 Navier-Stokes 強制爆破定理時也附帶了 Lean 形式化。此前 Math Inc. 在 24 維球填充問題上生成約 50 萬行程式碼,Meta 的 ATLAS 專案則自動形式化了 26 本教科書的大部分內容。
ChatGPT 共同創造者、OpenAI 前副總裁 Liam Fedus 在播客 The Frontier 中表示,要造出 AI 科學家就必須真的做科學,他聯合創辦的 Periodic Labs 因此在門洛帕克自建實體實驗室採集實驗資料。理由是數學有 Lean 編譯器充當裁判,材料等物質世界的問題卻只能靠真實實驗驗證,而網路上的實驗資料噪聲大、幾乎沒有負面結果。
a16z 合夥人 Olivia Moore 發布消費者 AI 百強應用報告:ChatGPT 仍遙遙領先,Suno、ElevenLabs 等中小產品展現出持久力。報告發現社交、約會、電商、旅遊、金融、健康等類別在百強榜上完全沒有產品入選,美國也僅 2.2% 的家庭為 AI 付費。
OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。
Ben Affleck 本週因多段訪談影片走紅,他在其中講解神經網路、transformer、張量等概念,並稱自己會寫點 Python。他透露做法是拿開源模型微調:解凍權重、只訓練最後一層「電影感」層,讓劇組達到製片標準,該技術已用於其電影《Animals》後期。他創立的 AI 影視公司今年被 Netflix 收購,報導金額 5.87 億美元,他本人稱這個數字不準確。他還表示不擔心 AI 接管影視業,更擔心學生的習得性無助與大學 A 成績三年上升 30%。
數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。
白宮召集扎克伯格、貝索斯、馬斯克、Anthropic 的 Dario Amodei 等主要科技 CEO 簽署 AI 安全承諾,川普稱其具有道德約束力。川普同時簽署行政令,正式將 AI 重新命名為超級智慧。與此同時,Meta 和 OpenAI 正為 AI 產品換上更友好的形象,但消費者中僅 2% 願意為此付費。
一篇評論用斯特魯加茨基兄弟的科幻小說《路邊野餐》類比 AI 對科學的衝擊:AI 實驗室正成批產出數學發現,多到要另附導讀,速度遠超學界消化能力。作者稱這類「發現傾倒」會出現在所有能閉環快速驗證的領域;NYU 數學教授 Tristan Buckmaster 提到最近一批 AI 科學論文讓整個研究專案一夜之間被抹掉。文章的核心判斷是答案將越來越先於理解到來,理解成為瓶頸,這或許也是反加速主義少有的有效論據。
企業一度鼓勵員工儘可能多地使用 AI,即所謂的 #tokenmaxxing,隨後賬單隨之而來。報導援引一項針對近 400 家企業的調查稱,其中只有 11% 能準確預測自己的 AI 支出。AI 使用量以 token 計量,而企業發現 token 很難統計,這讓 AI 預算幾乎無法編制。
OpenAI 公布 372 項數學與理論電腦科學成果,其中包括 Subhash Khot 的 Unique Games Conjecture(UGC)證明,推薦名單有 Timothy Gowers、Edward Witten 等數學家。UGC 意味著許多最佳化問題即使只想比半正定規劃鬆弛略好地近似,也是 NP-hard。部分成果附 Lean 證書,但幾乎所有證明尚未被人類理解;
OpenAI 新平台發布系列首篇隨筆《永恆的互補》,作者為 Hemanth Asirvatham 與 Elliott Mokski,文末註明觀點不代表 OpenAI。文章引用 Nick Bloom 等研究:維持摩爾定律所需研究人員數量是 1970 年代初的 18 倍以上,1930 年代以來全經濟有效研究投入增長 23 倍,而研究生產率下降 41 倍。作者據此提出「制度智慧」概念,認為前沿智慧與執行能力互為補充,超級智慧的價值可能更多體現在重複性執行工作上。
Jev 母公司 TypeSafe AI 完成 8.7 億美元 A 輪融資,投後估值 75 億美元,距 9 月 15 日種子輪的 2 億美元僅 24 天。Jev 砍掉生成能力、只做分類打分與選擇,輸出 token 永久免費,輸入每百萬 token 0.042 美元;上線 3 天日吞吐量達 1 萬億 token,接入 Vercel AI Gateway 後 24 小時內被近 13% 付費團隊採用,約三分之一《財富》500 強已在用。
OpenAI 開發者官方帳號 @OpenAIDevs 發布預告,稱要在 2030 年的舊金山跨越七個關卡,收集資金與關注者。帖文正文只有這一句,並以冒號結尾,發布時間為 2026 年 10 月 7 日。文中沒有說明這是遊戲、活動還是產品,也未給出參與方式、時間、平台或獎勵等細節。
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
AI 創意平台 Melius 宣布累計融資 2500 萬美元,其中 CRV 領投 2000 萬美元 A 輪,General Catalyst 領投 500 萬美元種子輪。這家紐約公司由三名前 Ramp 工程師創辦,最初做廣告投放管理最佳化工具,做了半年多後認定方向走不通,推翻並重寫全部程式碼,轉向生成廣告創意素材與營銷活動的 agents lab。公司稱 7 月結束隱身狀態後兩個月內年化收入已超 100 萬美元,同賽道還有 Higgsfield、Krea、Flora AI。
a16z 第七版《百強 AI 消費者應用》報告首次新增月收入榜單,Meshy 位列第 31 名,是榜上唯一的 AI 3D 公司。該榜單依據資料分析公司 YipitData 追蹤的美國消費者銀行卡消費資料排名,同榜還有 OpenAI、Anthropic、Canva、Superhuman、Higgsfield。
OpenAI CEO Sam Altman 在 2026 年 10 月 1 日發帖表示,使用者應當能夠在任何需要的地方使用自己的 AI 訂閱。該表態未說明具體產品、實施方式或時間表,也未提及是否涉及跨平台或第三方應用。
Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。
Artificial Analysis 最新文生影片榜單中,影視公司 Utopai Studios 的模型 Utopai X 以 1150 分位列第二,與第一名阿里 Wan 3.0 僅差 7 分,據福布斯估算其估值約 10 億美元。該榜單由評審在不知道模型名字的情況下盲投產生;Utopai X 以 MiniMax 開源的影片模型 H3 為底子做後訓練,10 項能力中有 7 項比基座更接近頂尖水平,音訊同步、運鏡控制與物理提升最明顯。
Cal AI 聯合創始人 Zach Yadegari 為其新 AI agent 公司 Persona 融資 1000 萬美元,Vine Ventures 領投。Persona 是一款個人 AI 助理,配套 179 美元的可穿戴手環,靠按鍵或甩腕啟用而非全程錄音,預計 12 月發售;目前已免費 beta 形式在 iMessage 上執行,積累了數千名使用者,手環預售收入達五位數。
TypeSafe AI 以 75 億美元估值完成 8.7 億美元融資,由 Andreessen Horowitz 領投,紅杉與現有投資方 DCVC 參投。其模型 Jev 於 9 月 15 日發布,基於 transformer 架構但不是大語言模型,不輸出文字而是生成機率,公司稱之為「校準決策」,定位是自動化任務而非寫文字或程式碼。公司稱 Jev 速度明顯更快、消耗 token 遠少於 LLM,並稱已有三分之一財富 500 強企業在使用;
BBC 報導稱,AI 生成內容激增正催生所謂「人類溢價」,即人們更看重由人創作的藝術。音樂平台 Deezer 表示,其上傳曲目中 44% 由 AI 生成,調查顯示 97% 的聽眾無法分辨 AI 與人類作品,但超過半數受訪者仍在意創作者是不是人。學界正推動設立類似「公平貿易」的「人類製造」統一標識,已有書籍、電影和專輯封面標註「AI-free」。
The Verge 發表評論文章,認為人類的心智並不適合應對 AI,AI 行業把大腦等同於計算機的流行比喻過於簡化了人。文章引用控制論奠基人 Norbert Wiener 的「每個時代的思想都映照在其技術中」,並點名 Google 的 Demis Hassabis 稱大腦是圖靈機的生物近似、Elon Musk 稱應把大腦視為生物計算機。作者反駁這類說法,指出人類的複雜性遠超多數 AI 從業者的認知,而 AI 產品仍在不斷推進。完整內容見 The Verge。
輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。