AISpot

搜尋

依意思最接近的 30 筆

r/LocalLLaMA top of the day10/3 19:24AI 評分42

專用推理引擎興起,放棄通用性換極致效能

近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。

量子位● 精選10/5 05:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

機器之心● 精選10/4 12:38AI 評分68

AlphaGo 核心作者稱 LLM 不會推理,離開 DeepMind 創業

AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。

量子位● 精選10/6 08:59AI 評分75

陶哲軒轉向 AI 減速派,呼籲模型公司放慢數學研究

數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。

TechCrunch AI10/5 17:43AI 評分67

HackerRank 向客戶開放 AI 面試官 Chakra,已面試超 50 萬場

HackerRank 的 AI 面試 agent Chakra 結束約六個月 beta,週一起正式向企業客戶開放,測試期間已完成逾 50 萬場面試,Snowflake、Snorkel、Capgemini 等公司參與試用。候選人要在帶 AI 助手的畫布上處理真實程式碼倉庫任務,Chakra 會依據其操作追問思路,評估批判性思維、判斷力與「AI fluency」,即如何向 AI 描述問題、判斷其輸出並引匯出解法。

Hugging Face blog● 精選10/3 23:56AI 評分75

微軟與 Hugging Face 發布 ThinkingBox,按資料庫狀態給 AI agent 打分

微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。

Ars Technica AI● 精選10/1 17:28AI 評分78

AI 首次在 Stratego 上擊敗人類頂尖選手

卡內基梅隆、MIT、紐約大學與斯坦福的研究團隊開發出 AI「Ataraxos」,以 15 勝 1 負 4 平擊敗被公認為史上最強的 Stratego 選手 Pim Niemeijer。此前連 DeepMind 都未能造出穩定戰勝頂尖人類玩家的 Stratego 機器。該 AI 僅用 16 塊 GPU、數千美元訓練成本,相關成果針對的是資訊不完全、隱藏資訊隨時間長期展開的博弈。

Hacker News front page10/5 20:22AI 評分45

數學家 Jeremy Avigad 談 AI 衝擊下的數學研究

數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。

OpenAI News10/1 18:00AI 評分38

OpenAI 平台發文:超級智慧最大價值或在枯燥工作

OpenAI 新平台發布系列首篇隨筆《永恆的互補》,作者為 Hemanth Asirvatham 與 Elliott Mokski,文末註明觀點不代表 OpenAI。文章引用 Nick Bloom 等研究:維持摩爾定律所需研究人員數量是 1970 年代初的 18 倍以上,1930 年代以來全經濟有效研究投入增長 23 倍,而研究生產率下降 41 倍。作者據此提出「制度智慧」概念,認為前沿智慧與執行能力互為補充,超級智慧的價值可能更多體現在重複性執行工作上。

機器之心10/4 12:31AI 評分50

OpenAI 預告 Astra 6.1,主打刪減屎山程式碼

OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。

Hacker News front page● 精選10/6 23:17AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

X @GoogleDeepMind10/1 18:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。

Hacker News front page● 精選10/7 20:42AI 評分95

OpenAI 單日發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。

The Verge AI10/5 20:28AI 評分52

OpenAI 等實驗室攻克數學難題引發學界反彈

過去一年,OpenAI、Anthropic 等實驗室宣布解決了多個長期懸而未決的數學問題,其中甚至包括一道千禧年大獎難題,進展超出研究人員預期。但這些實驗室以矽谷式的高速推進,本應被慶祝的成果反而招致學界反彈,有數學家要求 OpenAI 證明未使用其工作成果,也有批評指向其行事方式。實驗室表示正在從早期的失誤中學習,承諾能否兌現尚待觀察。

X @OpenAI● 精選10/7 19:05AI 評分81

OpenAI 向所有 ChatGPT 使用者推送 GPT-6 與 Intelligent UI

OpenAI 宣布 GPT-6 和 Intelligent UI 開始在 ChatGPT 中面向所有人推送。Intelligent UI 提供快速、可互動的回答,讓日常問題更直觀、複雜話題更易理解,並能在回答中直接給出當前任務可用的互動工具。原文未提及定價、額度或可用地區等細節。

TechCrunch AI● 精選10/7 19:00AI 評分94

ChatGPT 上線 Intelligent UI,隨 GPT-6 引入可互動視覺介面

OpenAI 隨新 GPT-6 模型推出名為 Intelligent UI 的新介面,週三起面向 Pro、Plus、Business、Enterprise 使用者全球上線,免費與低價 Go 檔使用者週四可用。ChatGPT 回覆中將大量加入可點選按鈕、任務定製計算器、互動式圖表、可編輯圖形等元素,官方稱目標是讓複雜主題更易學習。使用者可像調整其他個性化設定一樣,減少回覆中的視覺內容。

X @OpenAI● 精選10/7 19:05AI 評分92

OpenAI 宣布 GPT-6 支援 Intelligent UI,回覆可含圖表與互動元素

OpenAI 官方帳號宣布,GPT-6 新增 Intelligent UI,可在回覆中組合文字、視覺內容與互動元素,並按使用者提問自行決定三者的組合方式。回覆因此能包含幫助解釋概念的圖形和圖表,也能嵌入可點選按鈕、表單等互動體驗,使用者可直接在對話中使用它們。OpenAI 未在該推文中說明該功能的上線時間、適用套餐、地區限制或是否需要額外設定。

Hacker News front page10/6 08:49AI 評分72

德國聯邦國防軍首次用 AI 篩查申請人極端主義傾向

德國軍事情報機構 MAD 首次啟用自研 AI 系統,篩查聯邦國防軍申請人中的右翼極端分子。該系統名為 uVTP(輔助憲法忠誠審查),由 MAD 與一家德國 IT 公司合作開發,自今年 7 月起審查所有申請人的網路活動,判斷其是否在網上傳播極端內容、關注右翼帳號或轉發此類材料。據《明鏡》報導,已有數萬名申請人被 AI 審查,低三位數的候選人因缺乏憲法忠誠被篩除;MAD 此舉是為應對未來幾年申請人數的快速增長做準備。

量子位● 精選10/6 07:45AI 評分89

OpenAI 瘋狂 28 天首日:GPT-6 提速 50%,網友實測未達標

OpenAI Codex 負責人 Tibo 的 28 天計劃首日,官方宣布 GPT-6 Astra 與 GPT-6.1 Sol 預設推理速度提升約 50%、達 50TPS,覆蓋官方訂閱及 OpenCode、Amp 等第三方接入,但網友實測僅約 35TPS。同期 OpenAI 在 ChatGPT 影像生成中測試視覺廣告,並將在幾週內為歐盟地區 ChatGPT 和 Codex 生成的文字加隱形水印。

X @GoogleDeepMind● 精選10/7 15:03AI 評分85

SynthID Detector 向所有人開放,可檢測多家 AI 生成內容

Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。

Hacker News front page10/7 09:00AI 評分45

Criteo 初級工程師:AI 時代真正的風險是永遠停在 Junior

在 Criteo 任職的初級工程師 Elise Baturone 認為,AI 不會讓軟體工程師消失,真正的風險是資深工程師消失、所有人永遠停在 Junior 階段。她把自己的 agent 調教成導師,用蘇格拉底式提問做理解檢查,並把「提問」和「review」當成需要自己練的技能:追問 agent 解釋設計選擇、引用來源、論證可疑方案,常能讓它自己發現錯誤。她承認這更費 token,但先弄懂再上線更省事;

The Verge AI10/5 11:00AI 評分42

The Verge 刊文:人類心智難以應對 AI

The Verge 發表評論文章,認為人類的心智並不適合應對 AI,AI 行業把大腦等同於計算機的流行比喻過於簡化了人。文章引用控制論奠基人 Norbert Wiener 的「每個時代的思想都映照在其技術中」,並點名 Google 的 Demis Hassabis 稱大腦是圖靈機的生物近似、Elon Musk 稱應把大腦視為生物計算機。作者反駁這類說法,指出人類的複雜性遠超多數 AI 從業者的認知,而 AI 產品仍在不斷推進。完整內容見 The Verge。

Ars Technica AI● 精選10/6 21:50AI 評分82

OpenAI 將在歐盟預設給 ChatGPT 輸出加水印

OpenAI 宣布將在歐盟自動為 ChatGPT 生成的文字加水印,其他地區也提供該功能,但預設關閉。這是為遵守 8 月生效的歐盟 AI Act,該法要求 AI 生成內容可被其他工具檢測。OpenAI 的水印方法名為 textGrain,屬專有技術並已發布技術論文:它在用詞中埋入人類難以察覺、也不影響輸出品質的模式,持有金鑰者可用專用檢測器識別。檢測器初期只向有限的研究者與機構開放,其他方需經申請審批逐步加入。

X @GoogleDeepMind10/1 12:43AI 評分57

@GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…

Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放形式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時不拖慢關鍵研究進度。官方未披露具體工具名稱、技術細節與適用限制。

X @OpenAIDevs● 精選10/6 21:47AI 評分78

@OpenAIDevs: Let your app choose the right model, tool, or action in near real-time with Decisions API, now avai…

OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。

OpenAI News● 精選10/6 11:00AI 評分67

OpenAI 用 Ironclad 合同任務訓練 GPT-6 Astra

OpenAI 公布與 AI 合同平台 Ironclad 的研究合作,GPT-6 Astra 成為首個用 Ironclad 任務訓練的前沿模型。雙方與 Ironclad 使用者共同定義了 11 項法律、商務與採購任務,如搭建保密協議、採購審批流程和可複用條款,每項任務熟練使用者約需 30 到 40 分鐘,評估標準為 8 到 50 條。

Hacker News front page10/4 08:53AI 評分41

Wolfram 撰文討論 AI 時代純數學研究的未來

Wolfram 於 2026 年 9 月 28 日發文,回應 AI 不斷解出數學題後“是否還需要人類做數學研究”的討論。他認為現代 AI 的最大價值在於挖掘人類數學知識庫並建立連線,但純數學的核心是引導提問的人類想像力;計算則能通過計算不可約性不斷生成全新結果。他以 1988 年 Mathematica 問世時類似的擔憂作類比,指出工具只是提升了可做的數學層次。

The Verge AI10/3 17:49AI 評分47

Capcom 稱正為與 AI 共同開發遊戲的未來做準備

在 Capcom Open Conference RE: 2026 上,程式設計師 Satoshi Ishida 以「REX 專案的前景與未來」為題演講,稱制作《生化危機》級別遊戲時連簡單任務都極其耗時,解決方案是把 AI 技術成功整合進開發流程。他表示為「與 AI 共同創造遊戲的未來」做準備。Capcom 此前曾稱不會使用 AI。

TechCrunch AI10/5 19:54AI 評分66

Instinct 將 AI agent 帶入群聊,好友無需註冊帳號

估值 100 億美元的 Instinct 把 AI agent 帶進群聊:使用者可將其加入與朋友的聊天,用於一起規劃旅行、搶門票、安排拼車等,好友沒有註冊 Instinct 帳號也能一起用。該功能先向 early access 使用者開放,之後擴充套件到全部使用者,使用者可讓 agent 把自己加入試用名單。Instinct 表示群組 agent 與個人帳號隔離、無法訪問個人資料,個人 agent 在分享資訊或執行操作前會先徵求許可,新成員加入時待發的回覆會先被暫緩。