AISpot

搜尋

依意思最接近的 30 筆

Latent Space● 精選10/7 00:55AI 評分90

OpenAI 發布 722 篇數學論文,來自未公開內部模型

OpenAI 在公開 GitHub 倉庫發布 722 篇數學手稿,稱其來自一個未發布的內部前沿模型。這批結果出自約 4000 道研究問題的評估,分成 372 個結果族,平均每個結果消耗約 3 小時 ChatGPT Pro 算力,發布內容含論文、證明產物與部分推理摘要,模型本身不公開。OpenAI 稱發布方式諮詢過高等研究院的數學與 AI 獨立顧問組,Sam Altman 稱之為“發現的新紀元”。

機器之心● 精選10/7 08:54AI 評分91

OpenAI 公開 722 篇數學手稿,聲稱攻克多項名題

OpenAI 把一個尚未發布的內部模型產出的 722 篇數學手稿一次性放上 GitHub,歸入 372 個「成果族」,覆蓋數論、幾何、理論計算機、數學物理等 17 個方向。清單裡既有證明也有證偽,摘要中出現「證偽」「反例」的成果族約 50 個;約六成附有 Lean 形式化,其餘只能算聲稱,且絕大多數尚未經過同行評審。涉及的包括準黎曼猜想、BSD 公式、有理數域上的希爾伯特第十問題、唯一遊戲猜想、Hadwiger 猜想反例、埃爾德什等差數列猜想等。

The Verge AI● 精選10/6 19:26AI 評分83

OpenAI 公布 722 篇論文,未發布前沿模型解開數百數學難題

OpenAI 公開了由一款尚未發布的前沿模型產出的 722 篇論文手稿,稱其中解答了數百個長期懸而未決的數學問題。這批手稿覆蓋 372 個結果族,把相關論文歸入同一組,結果已預期數週才公布。新成立的獨立數學家顧問組 AGMAI 負責對外溝通這些成果。此前數學界對這些突破既感震動也存在爭議,並引發了關於研究倫理與學術規範的討論。

Hacker News front page10/8 05:29AI 評分61

數學界組織批評 OpenAI 一次性發布 700 餘份數學手稿

OpenAI 於 10 月 6 日發布了一個包含 700 多份數學手稿的倉庫,聲稱其中含有多項高知名度數學問題的解答。人類數學協會(Association for Human Mathematics)指出,OpenAI 自稱從中獲得正當性的數學與人工智慧諮詢組織,其最初宣告就明確前沿 AI 公司不應在內部模型上測試高等數學問題,OpenAI 的做法無視了這一核心前提。該協會還提到 OpenAI 正面臨抄襲、版權侵權與商標淡化的訴訟,並呼籲數學家停止與 OpenAI 合作。

量子位● 精選10/6 03:59AI 評分75

陶哲軒轉向 AI 減速派,呼籲模型公司放慢數學研究

數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。

Hacker News front page● 精選10/8 01:14AI 評分79

陶哲軒回應 OpenAI 數學成果:數學需轉向 Math 2.0

陶哲軒就 OpenAI 近期數學成果發文,提出數學研究應從「Math 1.0」轉向「Math 2.0」。他指出,AI 提示者自主解出公開問題後並不理解結果,無法答疑或作報告,相關研討會與合作遠少於傳統突破,新人流入減少,有前景的方向還被隱瞞以防被搶發。問題一旦被解決就無法回退,公開問題正被大規模、不可持續地收割,令整個數學領域變得貧瘠。他主張 Math 2.0 淡化單純解題,重視闡述、社群建設與開闢新方向,並重新評估教育、發表與晉升標準。

Hacker News front page10/8 04:08AI 評分56

OpenAI 撤回 3 篇數學論文,符號錯誤波及兩篇依賴論文

OpenAI 於 10 月 7 日撤回 3 篇數學論文:起因是《Algebraicity of Weil classes on split abelian eightfolds》中的符號錯誤,使 stabilization-trace 消去論證及所用構造失效,另兩篇依賴該構造的論文一併撤回,現已附說明並連結存檔版本。同期還修訂了 14 篇論文的證明、陳述與假設,另有 13 篇論文更新引用;新增 6 項形式化後,核心結果形式化比例為 300/719,約 42%。

量子位● 精選10/6 21:05AI 評分89

OpenAI 公開 722 篇數學手稿,涵蓋黎曼猜想與 BSD

OpenAI 一次性公開 722 篇數學手稿,歸為 372 組結果,全部出自一個尚未發布的內部模型,涉及準黎曼猜想、霍奇猜想、BSD 猜想、π的無理性指數、卡塔蘭常數無理性、唯一遊戲猜想等。據 OpenAI 介紹,模型共嘗試約 4000 個研究問題,平均每項結果消耗算力約相當於 ChatGPT Pro 思考 3 小時;論文、原始碼與部分 Lean 證明已上傳 GitHub。倉庫註明各手稿核驗進度不一,部分成果尚無 Lean 形式化證明。

Hacker News front page10/5 15:22AI 評分45

數學家 Jeremy Avigad 談 AI 衝擊下的數學研究

數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。

機器之心● 精選10/7 08:40AI 評分94

OpenAI 放出 722 篇數學手稿,稱攻下準黎曼猜想等難題

OpenAI 在 GitHub 倉庫 openai/math 公開 722 篇數學手稿,歸入 372 個成果族,全部由一個尚未發布的內部前沿模型產出。據 OpenAI 說明,模型被投餵約 4000 個研究問題,平均每個結果消耗約相當於 3 小時 ChatGPT Pro 思考的算力,手稿日期幾乎集中在 9 月 23 日至 10 月 5 日。372 族中有 235 族附帶 Lean 形式化,約佔六成三;OpenAI 承認未形式化的結果可能存在問題,且未公布模型名稱。

Hacker News front page10/4 03:53AI 評分41

Wolfram 撰文討論 AI 時代純數學研究的未來

Wolfram 於 2026 年 9 月 28 日發文,回應 AI 不斷解出數學題後“是否還需要人類做數學研究”的討論。他認為現代 AI 的最大價值在於挖掘人類數學知識庫並建立連線,但純數學的核心是引導提問的人類想像力;計算則能通過計算不可約性不斷生成全新結果。他以 1988 年 Mathematica 問世時類似的擔憂作類比,指出工具只是提升了可做的數學層次。

Hacker News front page● 精選10/7 15:42AI 評分95

OpenAI 單日發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。

X @OpenAI● 精選10/6 18:19AI 評分83

OpenAI 發布內部前沿模型產出的新數學成果

OpenAI 宣布公開一批由其內部前沿模型產出的數學結果,範圍較廣。OpenAI 表示,發布前諮詢了高等研究院(Institute for Advanced Study)的數學與人工智慧獨立諮詢組,並參考其建議與公開推薦來決定發布方式。公告未披露模型名稱、成果數量與具體內容,僅附一個連結。

Hacker News front page10/6 19:14AI 評分32

OpenAI 發布整數乘法低於 n log n 的數學預印本

OpenAI 於 2026 年 9 月 23 日發布數學預印本 Integer multiplication below n log n,作者署名 OpenAI。該文歸入 OpenAI Math Release preprint 系列,PDF 託管在 GitHub 倉庫 openai/math 的 preprints 目錄下,並隨文給出 BibTeX 引用條目。標題指向整數乘法複雜度低於 n log n 的結果,但原文未附摘要、演算法細節與具體複雜度常數。

Hacker News front page● 精選10/7 15:33AI 評分94

OpenAI 發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 公布 372 項數學與理論電腦科學成果,其中包括 Subhash Khot 的 Unique Games Conjecture(UGC)證明,推薦名單有 Timothy Gowers、Edward Witten 等數學家。UGC 意味著許多最佳化問題即使只想比半正定規劃鬆弛略好地近似,也是 NP-hard。部分成果附 Lean 證書,但幾乎所有證明尚未被人類理解;

Hacker News front page● 精選10/6 18:22AI 評分86

OpenAI 公開內部模型產出的 722 篇數學手稿

OpenAI 公開了一個倉庫,收錄其內部模型產出的 722 篇數學手稿,分為 372 個族,並附部分 Lean 形式化與 10 項結果的推理摘要。這些成果來自對開放研究問題的評估,絕大多數由同一個未發布的內部模型完成,平均每個結果消耗 3 小時 ChatGPT Pro thinking 算力,評估期間共提出約 4000 個問題。倉庫內的結果處於不同驗證階段,並非都有 Lean 形式化,未形式化的部分可能存在問題;

The Verge AI10/5 15:28AI 評分52

OpenAI 等實驗室攻克數學難題引發學界反彈

過去一年,OpenAI、Anthropic 等實驗室宣布解決了多個長期懸而未決的數學問題,其中甚至包括一道千禧年大獎難題,進展超出研究人員預期。但這些實驗室以矽谷式的高速推進,本應被慶祝的成果反而招致學界反彈,有數學家要求 OpenAI 證明未使用其工作成果,也有批評指向其行事方式。實驗室表示正在從早期的失誤中學習,承諾能否兌現尚待觀察。

機器之心● 精選10/8 06:27AI 評分74

OpenAI 撤回 3 篇數學手稿,因一個正負號寫錯,另修訂 14 篇

OpenAI 從 openai/math 倉庫撤回了 3 篇與霍奇猜想相關的數學手稿,起因是第一篇在一處關鍵論證中把幾何操作的符號寫成 +1,按論文自身約定應為 -1,導致本應歸零的計數不為零,另兩篇因沿用該構造被一併撤回。倉庫手稿總數從 722 篇降至 719 篇,同時修訂 14 篇、13 篇更新引用,並新增 6 項 Lean 形式化,目前 300 篇主結果完成形式化,約佔 719 篇的 42%。OpenAI 強調撤回的是證明而非數學命題本身,原稿保留可查;

Hacker News front page● 精選10/6 18:17AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

X @AIatMeta10/2 15:11AI 評分43

@AIatMeta: 4️⃣ Optimization: When can you replace a hard math problem with a simpler one without losing anythi…

Meta AI 在社交平台介紹了一項最佳化領域的新研究:研究者與 Muse Spark 合作,證明了一條明確規則,用於判斷某個簡化在什麼條件下能精確還原原始數學問題、在什麼條件下會留下差距。該結果針對的是用更簡單問題替換困難數學問題的場景,論文連結已隨帖文給出。

Hacker News front page10/8 03:05AI 評分45

OpenAI 數學倉庫撤回 3 項結果,新增 6 項 Lean 形式化

OpenAI 更新了其 GitHub 數學倉庫,撤回了 3 項已收錄的數學結果。同一批更新還新增 6 項 Lean 形式化、修改 19 項,倉庫目前約有 42% 的 top-line 結果完成形式化。維護者 Dan Roberts 公布了這一變動,並表示會繼續補充新的形式化內容,同時記錄發現的勘誤。

X @sama10/6 20:06AI 評分32

Sam Altman 稱正進入發現新紀元,附 OpenAI 數學進展頁面

OpenAI CEO Sam Altman 在 X 發帖稱「我們正進入發現的新紀元」,並附上 OpenAI 官網一則題為 Sharing AI progress in mathematics 的頁面連結。推文字身沒有給出更多說明,未披露涉及的具體模型、數學成果或時間表,資訊集中在所連結的頁面上。發帖時間為 2026 年 10 月 7 日。

Simon Willison10/7 00:47AI 評分33

24 年鑽研 Barnette 猜想者稱它已在 openai/math 被證明

在 Hacker News 關於 openai/math 的討論中,Jake Boggan 稱自己斷續研究了 24 年的 Barnette 猜想似乎已被證明,編號是 problem 180。他早年沉迷圖論,曾搬到布達佩斯跟隨名家學習,期間開始做這個問題,前後投入數千小時,去年夏天還一度以為是自己解出來的。得知結果後,他說不知道該怎麼想,這種感受像聽說前女友突然死於車禍,並猜當晚不少人心情複雜。

量子位● 精選10/5 00:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

Hacker News front page● 精選10/7 11:24AI 評分76

論文:Lean 驗證 AI 形式化證明不等於原證明正確

arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。

量子位● 精選10/8 05:28AI 評分81

PaperBenchX 發布:GPT-6 Astra 完整復現率僅 13.98%

UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。

量子位● 精選10/2 03:27AI 評分78

丘成桐新論文致謝 GPT 6 Astra 和 Claude Pro

丘成桐參與的最新論文在致謝中感謝 GPT 6 Astra 和 Claude Pro,稱其幫助探索了部分證明思路和計算。論文處理的是七維空間 27 種「怪球」能否具有嚴格正截面曲率的問題,該問題 1982 年被丘成桐列入自己的問題清單,懸置約 70 年。論文還附帶 SageMath 驗證程式碼,並宣告人工驗證與寫作由作者負責。