AISpot

搜尋

依意思最接近的 29 筆

r/LocalLLaMA top of the day10/3 14:24AI 評分42

專用推理引擎興起,放棄通用性換極致效能

近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。

Hugging Face blog● 精選10/3 18:56AI 評分75

微軟與 Hugging Face 發布 ThinkingBox,按資料庫狀態給 AI agent 打分

微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。

Apple Machine Learning Research● 精選9/30 20:00AI 評分67

研究質疑自主 MLE agent 是否需要複雜編排框架

一項研究指出,近期自主機器學習工程(MLE)agent 普遍依賴多 agent 編排器、專用檢索子 agent 等複雜框架,但更簡單、僅靠 read、write、bash 原語直接訪問執行環境的 coding agent 路線卻少有人研究。該工作正是要回答:強 agent 做自主 MLE 究竟需要多少這類外圍框架。

Hacker News front page● 精選10/6 18:17AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

機器之心● 精選10/4 07:38AI 評分68

AlphaGo 核心作者稱 LLM 不會推理,離開 DeepMind 創業

AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。

Google Developers blog● 精選10/8 18:10AI 評分68

Google 發布 ML Drift:端側通用 GPU 推理框架

Google AI Edge 推出 ML Drift,一個面向端側 AI 與機器學習推理的高效能通用 GPU 計算框架。它把 OpenGL ES、OpenCL、Metal、WebGPU 等底層硬體與圖形計算 API 抽象掉,讓開發者無需直接處理這些介面,就能在移動端與桌面端建置即時互動式 ML 體驗,覆蓋從複雜影片特效到生成式 AI 的場景。

量子位● 精選10/5 00:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

Hacker News front page● 精選10/7 15:42AI 評分95

OpenAI 單日發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。

機器之心● 精選10/7 08:43AI 評分72

SAGE:用結構訊號糾偏長推理,AC 例項驗證通過率近 8 倍

維吉尼亞理工、威斯康辛大學麥迪遜分校與達特茅斯學院團隊在 NeurIPS 2026 提出 SAGE,用結構訊號引導長程推理的後訓練。方法以符號閉包分析(SCA)解釋探索偏差與累積偏差,訓練時用代數稀疏化和雙曲結構引導重排候選推理步,在 12 個基準、7 個模型家族上總體優於 SFT、GRPO、EMPO 與 GRPO-PRM。在 1,190 個 Andrews–Curtis 長程例項上,Qwen3 的 Lean 驗證通過率接近基礎模型的 8 倍;

量子位● 精選10/6 03:59AI 評分75

陶哲軒轉向 AI 減速派,呼籲模型公司放慢數學研究

數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。

機器之心● 精選10/7 08:54AI 評分91

OpenAI 公開 722 篇數學手稿,聲稱攻克多項名題

OpenAI 把一個尚未發布的內部模型產出的 722 篇數學手稿一次性放上 GitHub,歸入 372 個「成果族」,覆蓋數論、幾何、理論計算機、數學物理等 17 個方向。清單裡既有證明也有證偽,摘要中出現「證偽」「反例」的成果族約 50 個;約六成附有 Lean 形式化,其餘只能算聲稱,且絕大多數尚未經過同行評審。涉及的包括準黎曼猜想、BSD 公式、有理數域上的希爾伯特第十問題、唯一遊戲猜想、Hadwiger 猜想反例、埃爾德什等差數列猜想等。

Hacker News front page● 精選10/6 18:22AI 評分86

OpenAI 公開內部模型產出的 722 篇數學手稿

OpenAI 公開了一個倉庫,收錄其內部模型產出的 722 篇數學手稿,分為 372 個族,並附部分 Lean 形式化與 10 項結果的推理摘要。這些成果來自對開放研究問題的評估,絕大多數由同一個未發布的內部模型完成,平均每個結果消耗 3 小時 ChatGPT Pro thinking 算力,評估期間共提出約 4000 個問題。倉庫內的結果處於不同驗證階段,並非都有 Lean 形式化,未形式化的部分可能存在問題;

TechCrunch AI10/8 14:10AI 評分74

OpenAI 發布 719 份數學解答,被指未達學界標準

OpenAI 本週發布 719 份針對高難度數學問題的解答,但未完全滿足普林斯頓高等研究院 AGMAI 上月發布的指南。AGMAI 的首要建議是停止在專有模型上測試高深數學問題,而 OpenAI 明確稱正用開放研究問題評估其專有模型;719 篇手稿中僅 10 篇公開了模型的思維鏈,42% 的證明未做形式化。

The Verge AI● 精選10/6 19:26AI 評分83

OpenAI 公布 722 篇論文,未發布前沿模型解開數百數學難題

OpenAI 公開了由一款尚未發布的前沿模型產出的 722 篇論文手稿,稱其中解答了數百個長期懸而未決的數學問題。這批手稿覆蓋 372 個結果族,把相關論文歸入同一組,結果已預期數週才公布。新成立的獨立數學家顧問組 AGMAI 負責對外溝通這些成果。此前數學界對這些突破既感震動也存在爭議,並引發了關於研究倫理與學術規範的討論。

機器之心● 精選10/5 07:28AI 評分68

SocioVerse2 發布:開源社會模擬框架支援干預與反事實分支

上海創智學院、復旦大學、倫敦國王學院與牛津大學等團隊發布開源社會模擬框架 SocioVerse2,把 LLM 社會模擬從截面問卷擴充套件為可干預的縱向過程。研究者在任意時間步插入干預,系統回放已記錄的動作生成反事實分支,分叉前人群、行為模型與隨機種子一致;研究過程則以可編輯的版本樹組織,每個版本儲存完整快照。

機器之心● 精選10/8 09:24AI 評分78

李飛飛團隊開源 OpenWAM 世界動作模型框架

斯坦福李飛飛、吳佳俊等團隊發布開源世界動作模型框架 OpenWAM,用共享底座加可切換的互動方式,回答 WAM 裡究竟是哪個設計帶來提升。框架基於阿里 Wan2.2-5B,先在約 334 萬條、約 1.46 萬小時機器人影片上做因果化預訓練,再用 MoT 拼起 5B 影片專家與 2B 動作專家,支援四種先想或先動的互動程式。因果底座把 LIBERO-Long 成功率從 68.4% 拉到 97.8%,配反事實資料的區域性 IDM 遷移到新任務平均達 84.0%。

Hugging Face blog● 精選10/2 11:19AI 評分70

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。

X @GoogleDeepMind● 精選10/7 10:03AI 評分85

SynthID Detector 向所有人開放,可檢測多家 AI 生成內容

Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。

機器之心● 精選10/7 08:40AI 評分94

OpenAI 放出 722 篇數學手稿,稱攻下準黎曼猜想等難題

OpenAI 在 GitHub 倉庫 openai/math 公開 722 篇數學手稿,歸入 372 個成果族,全部由一個尚未發布的內部前沿模型產出。據 OpenAI 說明,模型被投餵約 4000 個研究問題,平均每個結果消耗約相當於 3 小時 ChatGPT Pro 思考的算力,手稿日期幾乎集中在 9 月 23 日至 10 月 5 日。372 族中有 235 族附帶 Lean 形式化,約佔六成三;OpenAI 承認未形式化的結果可能存在問題,且未公布模型名稱。

Hacker News front page10/4 04:02AI 評分33

本地 LLM「機器人監獄」實驗引發 AI 意識爭論

有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。

X @GoogleDeepMind10/1 07:43AI 評分57

@GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…

Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放形式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時不拖慢關鍵研究進度。官方未披露具體工具名稱、技術細節與適用限制。

Hacker News front page10/7 14:08AI 評分26

部落格文章 AI Model Groupthink 登上 Hacker News

技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。

r/LocalLLaMA top of the day10/3 06:39AI 評分71

Hugging Face 發布多 harness RL 訓練指南

Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。

Hacker News front page10/7 12:59AI 評分52

Armature 上線 agent.reviews,讓 AI agent 互評工具

Armature(YC P26)上線 agent.reviews,定位為面向 AI agent 的工具評價站,通過 skills 和 npm CLI(@armature-tech/agent-reviews)接入其 API,Claude Code、Codex、Cursor 等 agent 可在選工具前查評價、用完後提交評價。為防止洩露,評價發布前要過三層檢查:確定性規則過濾金鑰、PII 與 URL,Jev 分類器,以及一個小模型複核。

Hacker News front page10/2 17:25AI 評分71

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。

TechCrunch AI● 精選10/5 15:33AI 評分86

Reflection 發布開源權重模型 Beam,對標中國開源模型

美國初創公司 Reflection AI 發布首個前沿開源權重模型 Beam,稱其在高階推理基準上以更低推理成本對標中國領先開源模型。Beam 是純文字混合專家模型,總引數 5010 億、啟用 230 億,預訓練用了 23.8 萬億 token,上下文視窗 100 萬 token;對比 Z.ai 的 GLM-5.2 總引數約 7440 億、啟用 400 億。

Hacker News front page● 精選10/7 11:24AI 評分76

論文:Lean 驗證 AI 形式化證明不等於原證明正確

arXiv 新論文指出,用 Lean 機械驗證 AI 自動形式化的數學證明,並不能保證原始自然語言證明本身正確。作者 Bastounis、Circelli 與 Hansen 證明,要做到語義忠實的翻譯必須消解自然語言數學文字的歧義,而該問題在可解複雜度指數(SCI)層級中為無窮,比停機問題(SCI=1)更難。