AISpot

研究

10月2日星期五 · 12 則

  1. Hugging Face blog● 精選AI 評分65

    Ai2 開源 AstaBrief 8B 科學報告生成模型

    Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。

  2. X @awnihannunAI 評分5

    @awnihannun: I'm upping my P(doom) 'cause the future goes foom

    Apple 研究員 awnihannun 在 2026 年 10 月 2 日發帖稱自己上調了 P(doom),即對 AI 帶來災難性後果的主觀機率估計,理由是“未來會 foom”,即智慧爆炸式增長。帖子以四行押韻短詩寫成,還提到中文房間、shoggoth 與死神之眼等 AI 圈梗,但沒有給出具體數字、時間表或技術依據。

  3. Google AI blog● 精選AI 評分68

    Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

    Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。

  4. 量子位AI 評分58

    丘成桐新論文致謝 GPT 6 Astra 與 Claude Pro

    丘成桐參與的最新論文在致謝中感謝 GPT 6 Astra 與 Claude Pro,稱兩者幫助探索了部分證明思路和計算。論文證明七維空間的 28 種球面(含 27 種怪球)都能配上截面曲率嚴格為正的度量,補上了 2020 年非負曲率結果到正曲率的最後一步;該問題是丘成桐 1982 年列進自己問題清單的第二位,已懸置約 70 年。論文附帶一套 SageMath 編寫的驗證程式碼,作者宣告人工驗證與論文寫作由自己負責,結論仍待數學界接受。

  5. 量子位AI 評分50

    arXiv 新規:每人每月最多提交 2 篇論文,拒稿不退額度

    arXiv 自 2026 年 10 月 1 日起實行新規:每個提交者每個自然月最多提交 2 篇論文,所有分類共用同一額度,換區不加量。額度按提交次數計算,論文被拒也照樣消耗一次;只在正式 announce 前主動刪除才不佔額度。2024 年起仍保留同時最多 3 篇 active 投稿的限制。官方稱這是臨時限速措施:2026 年 9 月投稿量達 40363 篇,兩年翻一倍,cs.AI 分類兩年增長超 6 倍,AI 生成的 thin papers、salami papers 擠佔志願稽核員時間,正常投稿可能被拖延數天到數週。

  6. Hugging Face blogAI 評分46

    ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

    ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。

  7. X @karpathyAI 評分50

    Karpathy 建議用圖表、網頁和影片理解 LLM 輸出

    Karpathy 認為,隨著 LLM 能力提升,人的工作會更多轉向監督與理解模型輸出,而 LLM 本身也能幫忙。他推薦幾個技巧:讓模型用 ASD-STE100 受控語言寫作,或要求輸出 HTML 網頁、圖表,甚至定製講解影片,例如用 ElevenLabs API key 生成 3b1b 風格影片。這些大型、一次性軟體產物以前不值得做,現在可以按需生成。

  8. Latent Space● 精選AI 評分67

    Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

    Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

  9. Apple Machine Learning ResearchAI 評分53

    論文證明離散擴散單步取樣僅能匹配條件獨立位置

    研究證明,離散擴散(含 remasking 與 uniform-state 取樣器)的某一步只有在所寫入位置在已固定 token 條件下相互獨立時,才與訓練分佈一致;任何 per-position 分佈的乘積都無法匹配存在依賴的一組 token。文中指出畫素、音素、詞等常見領域的 token 之間存在固有依賴,而這類取樣器每步會寫入多個 token 位置,每個位置從各自的 per-position 分佈取樣,並依據同一批分佈決定寫入哪些位置。

  10. Apple Machine Learning ResearchAI 評分33

    強化語種判別可縮小多語言語音模型的單語差距

    多語言自監督語音模型在總預訓練資料預算相同的情況下,表現仍不如單語模型。研究發現,在預訓練階段強化模型區分語言的能力,可縮小這一多語言差距,並在部分連續語音學與更高層語言學指標上將其消除,同時保留大量跨語言資訊共享。實驗採用受控的英語/法語 HuBERT 設定,測試了兩種強化語言判別的干預手段,其中一種是輔助語言任務。

10月1日星期四 · 11 則

  1. X @AnthropicAIAI 評分56

    @AnthropicAI: In physics, an “impedance mismatch” occurs when two systems each work well but are poorly matched.

    Anthropic 發布 Science Blog 客座文章,哈佛物理學家 Matthew Schwartz 提出 AI 與科學之間存在類似物理學的“阻抗失配”:LLM 能力很強,但像對待人類合作者那樣使用它並非激發其科學優勢的最佳方式。為此他建置了一套用於定量科學精確計算的工具包,Claude 藉此發現了與生態學、群體遺傳學等十幾個領域的聯絡,Schwartz 再與領域專家合作把方向引導到有趣的問題上。

  2. X @GoogleDeepMindAI 評分42

    @GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

    Google DeepMind 發布一期播客,討論 AI 生成內容逼真化後如何驗證內容來自人類、機器還是自然,核心手段是來源溯源與不可感知水印。節目時間軸顯示內容涵蓋水印定義、SynthID、影像與影片、SynthID Bio 以及未來韌性,其中 SynthID 部分從 4 分 35 秒開始,SynthID Bio 從 19 分 28 秒開始。

  3. Ars Technica AIAI 評分58

    AI Ataraxos 以 15 比 1 擊敗 Stratego 人類頂尖選手

    卡內基梅隆、MIT、紐約大學與斯坦福的團隊訓練出的 AI Ataraxos,在不完全資訊棋類 Stratego 上以 15 勝 1 負 4 平擊敗頂尖棋手 Pim Niemeijer,訓練只用 16 塊 GPU、花費幾千美元。此前連 DeepMind 也沒能做出穩定戰勝人類頂尖選手的機器。它與撲克一樣屬於不完全資訊遊戲,每方 40 枚棋子,身份只有碰撞交戰時才揭示,隱藏資訊量極大且展開時間很長。

  4. 量子位● 精選AI 評分66

    何愷明團隊 NAT-ARC:純視覺解 ARC,整合達 70.2%

    何愷明團隊提出純視覺 ARC 解題方案 NAT-ARC,不用 LLM,單模型(huge,0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合三種預訓練策略後達 70.2%,總引數約 2B。做法是先用 ImageNet(約 130 萬張自然影像)上訓練的 MAE encoder 權重初始化編碼器,再在 ARC 訓練集離線訓練,測試時對每道題單獨 LoRA 微調;

  5. X @GoogleDeepMindAI 評分42

    @GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…

    Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放方式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時,不拖慢關鍵研究進度。官方未披露具體模型名稱、效能資料或使用限制,僅提供研究用途的開放獲取連結。

  6. X @GoogleDeepMindAI 評分26

    @GoogleDeepMind: Acting like a digital ID card, the watermark can help DNA labs verify synthetic proteins and keep s…

    Google DeepMind 推出一種類似數字身份證的水印,可幫助 DNA 實驗室驗證合成蛋白質,並保持序列資料庫準確。隨著 AI 蛋白質設計請求規模不斷擴大,驗證設計是否來自帶內建防護的 AI,將幫助實驗室實現自動化並加強生物安全。

  7. X @GoogleDeepMindAI 評分40

    @GoogleDeepMind: SynthID Bio is our new family of watermarking methods made for AI-generated biological designs.

    Google DeepMind 推出 SynthID Bio,一套專為 AI 生成生物設計打造的水印方法。其首次實現將不可感知的簽名直接嵌入蛋白質序列,且不影響其生物功能。該技術面向 AI 生成的生物設計場景,具體使用方式與限制尚未披露。

  8. Apple Machine Learning Research● 精選AI 評分68

    強 coding agent 做自主 ML 工程需要多少 harness

    2026-10-01 發布的文章追問強 agent 在自主 ML 工程中究竟需要多少 harness。它指出,近期自主 MLE agent 在公開排行榜取得顯著進展,但現代 MLE agent 常建立在多 agent 編排器、專用檢索子 agent 等越來越複雜的裝置上;動機包括長週期進展停滯與 LLM 原語有限。相比之下,讓 LLM 通過 read、write、bash 直接訪問執行環境的更原始但改進的 coding agent,在領域內受到的關注很少。

  9. Anthropic Research● 精選AI 評分68

    物理學家用 Claude 打造 BootLoops 科研工具

    理論物理學家 Matthew Schwartz 發布開源工具 BootLoops,把 Claude 當作 LLM 的"挽具",專攻適合當前 AI 的"Claude 形狀"問題。他用 Claude Fable 5 移植並改進散射振幅計算方法,還借 BootLoops 把數學物理技術帶到生態學、群體遺傳學、地質、經濟、語言學等領域,並與各領域專家合作篩選真正有價值的問題。BootLoops 開源,可搭配任意模型使用,但當前 AI 仍無法解決科學中的大多數問題。

  10. Apple Machine Learning ResearchAI 評分59

    新論文 RLTL;DR:失敗後自寫 TL;DR 反饋做自我改進

    新論文 RLTL;DR 提出一種自我改進方法:模型每次嘗試失敗後,把驗證器輸出展示給它,讓它自己寫一條 TL;DR 式反饋,下一次 rollout 以這條反饋為條件。它針對 RLVR 的侷限——RLVR 要求多次嘗試並只向成功樣本最佳化,當任務難到成功率接近零、又沒有教師模型或範例解可蒸餾時就失效。論文發布於 2026-10-01,原文摘要未給出基準或具體數字。

9月30日星期三 · 5 則

  1. NVIDIA blogAI 評分15

    輝達開放 2027–2028 研究生獎學金申請,最高 6 萬美元

    輝達第 26 屆研究生獎學金專案開始全球接受申請,面向研究 AI、機器學習、自動駕駛、計算機圖形、機器人、醫療與高效能運算等方向的博士生,每人獎金最高 6 萬美元,並配導師與技術支援。申請者須在申請時已完成至少一年博士階段學習,截止日期為 2026 年 10 月 30 日;獲獎前還必須在 NVIDIA 研究辦公室完成 2027 年夏季的線下實習。該專案自 2002 年啟動以來已發放 220 多筆資助,總額約 800 萬美元。

  2. Google DeepMind blogAI 評分47

    SynthID Bio 為 AI 生成蛋白質嵌入可驗證水印

    SynthID Bio 是一項把水印嵌入生物程式碼的概念驗證技術:水印不僅能在數字模型上驗證,也能在合成出的實體蛋白質上驗證,且實驗室測試顯示不損害其生物功能。它按資料型別調整策略——微調蛋白質序列的胺基酸選擇、調整預測 3D 結構的原子座標,並通過微調 AlphaFold 3 擴散網路把水印寫進模型權重。

  3. Anthropic ResearchAI 評分55

    研究:機器人已能完成美國 34% 工時中的體力任務

    一項基於 O*NET 資料、用 Claude 評估任務暴露度的研究顯示,當今機器人已能完成美國 74% 的體力任務,佔全部工作時間的 34%;機器人與 LLM 合計覆蓋約 80% 的工作時間。但機器人僅在 0.3% 的任務上比人力更具成本競爭力,若價格按過去趨勢下降,40 年後這一比例才到 10%。暴露於機器人的崗位多為男性、低學歷、低薪,如駕駛與倉儲;護理與維修類崗位暴露度低。

  4. Apple Machine Learning ResearchAI 評分57

    系統研究:高效 steering 控制 LLM 輸出會大幅犧牲流暢度

    這篇論文系統比較了 LLM 條件控制(conditioning)方法在概念注入與概念移除兩類場景下的表現,發現高效的 steering 方法雖能成功控制輸出,卻往往以流暢度大幅下降為代價。作者指出,現有評估通常只關注能否注入或移除目標概念,忽視了生成品質,導致這一權衡長期缺乏清晰認識。原文摘要在此處截斷,未披露後續結論與具體方法清單。

  5. Hugging Face blogAI 評分46

    Hugging Face 發布 Open TTS Leaderboard,用客觀指標評多語言 TTS 與語音克隆

    Hugging Face 於 2026 年 9 月 30 日上線 Open TTS Leaderboard,用客觀指標評測開源與多語言 TTS 模型,單次評測從收集投票的數週縮短到數小時。指標包括 WER/CER(用 Qwen3 ASR 轉寫)、H200 批次離線推理的 RTFx、H200 與 CPU 上的流式首音訊延遲 TTFA,以及 WavLM 說話人嵌入的餘弦相似度 SIM。

9月29日星期二 · 6 則

  1. Simon Willison● 精選AI 評分73

    Anthropic 紅隊:GLM-5.3 在 4% 任務中實現控制流劫持

    Anthropic Frontier Red Team 在內部 Binary Exploitation 基準中隨機抽取 100 個任務評估多個模型:GLM-5.3 在 4% 的試驗裡實現了完整控制流劫持,Claude Mythos Preview 為 6%。此前模型 Claude Opus 4.6 與 GLM-5.2 在這些任務中一次都沒有成功。該團隊認為,GLM-5.3 的成績雖低於 Claude Mythos Preview,但一個有意義的能力門檻已被跨過。

  2. X @AnthropicAIAI 評分33

    Anthropic 啟動 AI 期望調研,Claude 使用者可參與

    Anthropic 於 9 月 29 日至 10 月 6 日開展新一輪 AI 調研,Claude 與 Claude Code 的 Free、Pro、Max 使用者均可參加,參與者可選擇公開自己的回答。去年 12 月的同類研究有 81,000 人參與,Anthropic 稱這是迄今規模最大的定性研究。調研結果將影響 The Anthropic Institute 的研究方向與公司決策,若多人提出 Anthropic 應改變做法,這些意見會被公開記錄。

  3. Hugging Face blog● 精選AI 評分66

    論文提出 ProvenanceGuard,為 MCP Agent 核查斷言來源歸屬

    MultiverseComputingCAI 發表論文提出 ProvenanceGuard:一個接在黑盒 MCP agent 之後的後生成驗證層,專門抓事實為真但歸屬錯誤的跨來源混淆,這類斷言可能被 RAGAS、MiniCheck 等只看合併證據的檢查器放過。它保留 MCP trace 中的 source ID,依次做斷言拆解、來源路由、支援度校驗與歸屬比對,輸出逐條來源判定和答案級的放行或攔截。

  4. Anthropic ResearchAI 評分27

    Anthropic 用 AI 訪談徵集公眾對 AI 的看法

    Anthropic 於 2026 年 9 月 29 日啟動新研究,用 Anthropic Interviewer 訪談使用者對 AI 的真實體驗與期待,參與者可自願將完整訪談公開。訪談問題包括最有意義的正面與負面經歷、希望 AI 改變的工作教育醫療政府等領域、以及對 AI 公司的要求;公開版本只附國家,不含 Claude 帳號姓名與信箱,但官方明確警告他人仍可能通過年齡、職業、城市等細節重新識別身份,且一旦公開無法刪除已被他人儲存的內容。

  5. Anthropic Research● 精選AI 評分81

    GLM-5.3 可自主建置端到端漏洞利用,防護易被繞過

    智譜 AI(海外稱 Z.ai)的 GLM-5.3 具備自主建置端到端網路漏洞利用的能力,且發布時未設有效防護,Anthropic 測試顯示攻擊者用簡單技巧即可在 64% 到 100% 的情況下繞過其防護。在 ExploitBench 上,GLM-5.3 於 410 次嘗試中成功開發出 50 次端到端利用,接近 Claude Mythos Preview 的 56 次;在內部二進位制利用基準中取得 4% 的完整控制流劫持,Claude Mythos Preview 為 6%。

9月28日星期一 · 1 則

  1. Mistral AI newsAI 評分41

    Mistral 在慕尼黑開設德國中心,聚焦工業 AI 與 Physics AI

    Mistral 於 2026 年 9 月 28 日在慕尼黑開設德國中心,內設 Physics AI 與 Industrial AI 研究團隊及直接服務企業客戶的應用工程師,並已在當地招聘。合作方包括 BMW(碰撞模擬與工程 AI)、Siemens Energy(工業 AI),以及與慕尼黑工業大學(TUM)用其風洞設施開發汽車空氣動力學數字孿生。

9月25日星期五 · 2 則

  1. X @AnthropicAI● 精選AI 評分70

    Claude 獨立算出九圈散射振幅,成本數千美元

    Anthropic 稱 Claude 在 Claude Science 中僅憑一條描述九圈問題的提示,基本無人監督執行數天,算出平面 N=4 超楊-米爾斯模型中的九圈散射振幅,總成本數千美元,打破此前八圈的紀錄。該結果由原紀錄保持者、SLAC 的 Lance Dixon 獨立驗證,物理學家兼科學作者 von Hippel 在 Anthropic 科學部落格撰文記錄。此前多數計算止步於兩到三圈,每加一圈計算量指數增長。

  2. Anthropic Research● 精選AI 評分67

    Claude 完成 N=4 超楊-米爾斯九圈振幅計算

    物理學家 Matt von Hippel 向 AI 公司發起挑戰,要求用學術機構級別的算力把 N=4 超楊-米爾斯理論算到九圈,Anthropic 的 Claude 在一個月內完成了。散射振幅通常只算到兩圈,少數到三圈,最精確的預測用到五圈;九圈此前被認為需要遠超學術機構可及的算力。N=4 超楊-米爾斯是振幅學界的玩具模型,不描述真實世界,專門用來檢驗新計算方法。

9月23日星期三 · 3 則

  1. Google DeepMind blogAI 評分57

    Google 為 Private AI Compute 加入伺服器端加密持久記憶

    Google 在 2026 年 9 月 23 日宣布為 Private AI Compute 平台加入伺服器端持久記憶:加密資料存在雲端專用儲存,解密金鑰只儲存在使用者裝置上,模型需要時通過端到端加密通道在 secure enclave 內臨時解密處理。此前該平台是無狀態的,任務一結束就清除全部上下文。Google 同時發布伺服器軟體的防篡改公開記錄,供裝置在傳送資料前驗證,並給出由一家網路安全公司完成的獨立審計結果。

更早的內容