AISpot

數學家發現 OpenAI 的 Navier-Stokes 證明兩個版本不一致

Hacker News front page新聞報導研究政策與安全

劍橋大學研究團隊指出,OpenAI 公布的 Navier-Stokes 證明中,Lean 形式化版本與自然語言版本並不一致,問題出在 Lemma 8.6:自然語言版要求某值小於 m+4,Lean 版卻放寬為小於 m+5,數學上更弱。團隊用 ChatGPT 逐條比對再人工核查,花了約兩週才找到這處真實差異,而 OpenAI 稱其智慧體僅用 88 小時生成證明。

研究給出了具體反例:AI 自動形式化會為通過編譯而悄悄把 Lemma 8.6 的條件從 m+4 放寬到 m+5,說明 Lean 版本不能替代人工同行評審,對關注 AI 數學證明可靠性與 722 篇論文驗證的人最有用。

原標題:OpenAI mistranslated mathematics into code for its Navier-Stokes proof
閱讀原文

評分86 / 82(平均 84,門檻 76)
狀態精選

相關報導

機器之心● 精選AI 評分89

OpenAI 公布納維-斯托克斯方程奇點構造證明

9 月 8 日 OpenAI 公布由內部 AI 系統產生的解析證明與 Lean 形式化證明,構造出三維不可壓縮納維-斯托克斯方程在有限時間內形成奇點的解,即千禧年大獎難題的一種可能答案。9 月 11 日 Clay Mathematics Institute 稱該工作「看起來已經解決」問題,但按規則論文仍需評審與長期檢驗,獎金尚未宣布歸屬。

Hacker News front page● 精選AI 評分76

論文:Lean 驗證 AI 形式化證明不等於原證明正確

arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。

Hacker News front page● 精選AI 評分95

OpenAI 單日發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。

機器之心● 精選AI 評分94

OpenAI 放出 722 篇數學手稿,稱攻下準黎曼猜想等難題

OpenAI 在 GitHub 倉庫 openai/math 公開 722 篇數學手稿,歸入 372 個成果族,全部由一個尚未發布的內部前沿模型產出。據 OpenAI 說明,模型被投餵約 4000 個研究問題,平均每個結果消耗約相當於 3 小時 ChatGPT Pro 思考的算力,手稿日期幾乎集中在 9 月 23 日至 10 月 5 日。372 族中有 235 族附帶 Lean 形式化,約佔六成三;OpenAI 承認未形式化的結果可能存在問題,且未公布模型名稱。

Hacker News front pageAI 評分71

Anthropic 用 Lean 自動形式化費馬大定理,11 天生成 1300 萬行

數學形式化正從人工轉錄轉為 AI 自動形式化:Anthropic 於 2026 年 9 月 4 日宣布完成費馬大定理的自動形式化,11 天生成 1300 萬行 Lean 程式碼;OpenAI 9 月 8 日公布 Navier-Stokes 強制爆破定理時也附帶了 Lean 形式化。此前 Math Inc. 在 24 維球填充問題上生成約 50 萬行程式碼,Meta 的 ATLAS 專案則自動形式化了 26 本教科書的大部分內容。