論文:Lean 驗證 AI 形式化證明不等於原證明正確
arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。
論文證明語義忠實的 AI 自動形式化在 SCI 層級中不可解,並用例項指出 OpenAI 公布的 Navier-Stokes 證明其 Lean 形式化與自然語言原文不符,對依賴 Lean 驗證 AI 數學結果的人有參考價值。
原標題:Navier–Stokes Lost in Translation
閱讀原文
| 評分 | 76 / 76(平均 76,門檻 76) |
|---|---|
| 狀態 | 精選 |
相關報導
Lean 形式化驗證 11 個正方形最優裝箱的完整證明
11 個正方形最優裝箱問題的完整最優性證明已在 Lean 4 中通過驗證:EvolvingPrograms 的驗證執行接受了全部 7,920 個本地 Lean 模組,最終審計為零 admission。該結果給出最優邊長 T=(6u+4)/(1+2u−u²),其中 u 是某八次多項式在 (9/25, 37/100) 內的唯一根,構造達到約 3.8770835900228141773。
OpenAI 單日發布 372 項數學成果,含 Unique Games 猜想證明
OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。
陶哲軒轉向 AI 減速派,呼籲模型公司放慢數學研究
數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。
清華團隊開源 VeriLoop E2,以外部驗證決定推理狀態提交
清華團隊開源後訓練模型 VeriLoop E2,由獨立外部 Verifier 決定候選狀態能否獲得提交資格,而非依賴模型內部置信度。該模型以 Qwen 3.8-27B 為基礎,面向程式碼、數學與物理三類可外部驗證任務,並同步發布標準權重與覆蓋 BF16 至 IQ1_M 的 GGUF 量化版,其中 Q6_K 為 20.566 GiB,比 BF16 小 58.96%。
OpenAI 放出 722 篇數學手稿,稱攻下準黎曼猜想等難題
OpenAI 在 GitHub 倉庫 openai/math 公開 722 篇數學手稿,歸入 372 個成果族,全部由一個尚未發布的內部前沿模型產出。據 OpenAI 說明,模型被投餵約 4000 個研究問題,平均每個結果消耗約相當於 3 小時 ChatGPT Pro 思考的算力,手稿日期幾乎集中在 9 月 23 日至 10 月 5 日。372 族中有 235 族附帶 Lean 形式化,約佔六成三;OpenAI 承認未形式化的結果可能存在問題,且未公布模型名稱。