Hacker News front page● 精選10/7 16:24AI 評分76
論文:Lean 驗證 AI 形式化證明不等於原證明正確
arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。
依意思最接近的 3 筆
arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。