數學家 Jeremy Avigad 談 AI 衝擊下的數學研究
數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。
依意思最接近的 16 筆
數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。
Wolfram 於 2026 年 9 月 28 日發文,回應 AI 不斷解出數學題後“是否還需要人類做數學研究”的討論。他認為現代 AI 的最大價值在於挖掘人類數學知識庫並建立連線,但純數學的核心是引導提問的人類想像力;計算則能通過計算不可約性不斷生成全新結果。他以 1988 年 Mathematica 問世時類似的擔憂作類比,指出工具只是提升了可做的數學層次。
過去一年 OpenAI、Anthropic 等實驗室宣稱在多個長期未解的數學難題上取得突破,其中一項是著名的千禧年大獎難題,能力超出研究者對現有系統的預期。但推進方式被批像失控的推土機,原本該被慶祝的結果反而引發數學界反彈,有數學家要求 OpenAI 證明沒有使用他們的工作。實驗室稱正從早先的錯誤中學習,能否兌現仍待觀察。
Meta AI 在社交平台介紹了一項最佳化領域的新研究:研究者與 Muse Spark 合作,證明了一條明確規則,用於判斷某個簡化在什麼條件下能精確還原原始數學問題、在什麼條件下會留下差距。該結果針對的是用更簡單問題替換困難數學問題的場景,論文連結已隨帖文給出。
AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。
Meta AI 研究人員與 Muse Spark 合作,將數論中的一個想法與弦理論中的一項計算聯絡起來,證明該聯絡在比此前已知更多的情況下成立。這項工作建立在 1980 年代的想法之上,論文已在 Meta AI 研究頁面發布。
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
Meta AI 披露,研究人員通過找到一個反例,推翻了關於描述對稱性的數學結構的一項既有規則猜想。Muse Spark 生成了用於搜尋該反例的程式碼,團隊隨後驗證了結果並完成了證明。相關論文已放出連結。
有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。
《紐約時報》雜誌刊文指出,賭博與預測市場的統計邏輯已成為矽谷產品與商業決策的底層思維。文章將這一邏輯與預測市場、統計推斷等機制聯絡起來,討論其如何滲透進科技行業的運作方式。該文於 2026 年 10 月 4 日發布,在 Hacker News 上獲得 4 個點數、暫無評論。
Meta AI 團隊與 Muse Spark 合作,在受生物學啟發的數學結構研究中,找到了一個被提出規則的反例,並進一步給出替代性刻畫,經研究人員驗證與完善。相關論文已發布。
卡內基梅隆、MIT、紐約大學與斯坦福的研究團隊開發出 AI「Ataraxos」,以 15 勝 1 負 4 平擊敗被公認為史上最強的 Stratego 選手 Pim Niemeijer。此前連 DeepMind 都未能造出穩定戰勝頂尖人類玩家的 Stratego 機器。該 AI 僅用 16 塊 GPU、數千美元訓練成本,相關成果針對的是資訊不完全、隱藏資訊隨時間長期展開的博弈。
The Verge 發表評論文章,認為人類的心智並不適合應對 AI,AI 行業把大腦等同於計算機的流行比喻過於簡化了人。文章引用控制論奠基人 Norbert Wiener 的「每個時代的思想都映照在其技術中」,並點名 Google 的 Demis Hassabis 稱大腦是圖靈機的生物近似、Elon Musk 稱應把大腦視為生物計算機。作者反駁這類說法,指出人類的複雜性遠超多數 AI 從業者的認知,而 AI 產品仍在不斷推進。完整內容見 The Verge。
近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。
微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。
OpenAI 新平台發布系列首篇隨筆《永恆的互補》,作者為 Hemanth Asirvatham 與 Elliott Mokski,文末註明觀點不代表 OpenAI。文章引用 Nick Bloom 等研究:維持摩爾定律所需研究人員數量是 1970 年代初的 18 倍以上,1930 年代以來全經濟有效研究投入增長 23 倍,而研究生產率下降 41 倍。作者據此提出「制度智慧」概念,認為前沿智慧與執行能力互為補充,超級智慧的價值可能更多體現在重複性執行工作上。