AISpot

搜尋

依意思最接近的 30 筆

Hugging Face blog10/2 00:01AI 評分58

ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料

ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。

量子位● 精選10/5 00:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

Hacker News front page● 精選10/8 02:09AI 評分77

AI 研究者對 AI 導致人類滅絕的機率中位數首次升至 10%

AI Impacts 於 2024 年 12 月調查 1,580 名頂會 AI 研究者,他們對「未來 AI 導致人類滅絕或永久喪失自主」的機率中位數首次升至 10%,高於一年前的 5%。同一調查中「極度糟糕(如人類滅絕)」的中位數仍為 5%,自 2016 年以來未變,而人類水平 AI 出現的中位年份從 2016 年的 2061 年提前到 2042 年。

Latent Space● 精選10/8 12:27AI 評分69

Periodic Labs 訪談:用物理實驗訓練 AI 科學家,加速材料發現

Periodic Labs 聯合創始人 Liam Fedus 與 Ekin Dogus Cubuk 在一檔播客中介紹了其「合成超級智慧」構想:以真實物理實驗作為強化學習環境,訓練能自主發現新材料的 AI 科學家。這家成立一年的公司正搭建自動化實驗室,希望讓每臺儀器擁有「140 IQ」,並用做科學的完整過程而非僅論文結果來訓練模型。他們認為失敗的實驗可能是最有價值的訓練資料,自主實驗可把數十年的試錯壓縮到數月,目標材料涵蓋室溫超導、磁體與電池。

Latent Space● 精選10/2 10:04AI 評分75

Airbnb 稱 60% 程式碼由 AI 編寫,半數客服工單由 AI 解決

Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。

X @GoogleDeepMind10/1 13:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。

TechCrunch AI10/5 10:35AI 評分57

研究者發現一支中國 AI agent fleet,疑執行於騰訊、呼叫高德地圖

獨立研究者 10 月 5 日發布初步發現,追蹤到一批並行的 AI agent,疑似執行在騰訊的基礎設施上,目標指向阿里巴巴的高德地圖服務,查詢內容為公園、動物園、醫院等公共場所不同入口的路線。研究者拒絕使用 swarm 一詞,稱應叫 agent fleet:多個 agent 執行同類任務,彼此之間沒有通訊跡象。這些活動是通過監控域名掃描服務 URLquery 的流量發現的,該服務常被 agent 用來載入無法直接訪問的網站並留下記錄;研究仍在進行中。

NVIDIA blog10/6 09:00AI 評分48

輝達報告:89% 電信運營商重視開源模型

輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。

量子位● 精選10/6 03:59AI 評分75

陶哲軒轉向 AI 減速派,呼籲模型公司放慢數學研究

數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。

Hacker News front page10/7 14:08AI 評分26

部落格文章 AI Model Groupthink 登上 Hacker News

技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。

Hacker News front page10/4 04:02AI 評分33

本地 LLM「機器人監獄」實驗引發 AI 意識爭論

有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。

Hacker News front page10/4 13:21AI 評分47

歐洲首屆前沿 AI 與法律研討會在英舉辦

ML4Good 與 EquiStamp 於 2026 年 9 月在英國東薩塞克斯舉辦了首屆歐洲前沿 AI 與法律研討會,為期五天,面向來自 12 個司法管轄區的 19 名資深法律、治理與風險專業人士。課程覆蓋從訓練、評估到 agent 與防護措施的前沿 AI 全流程,並對應採購、風險評估及供應商安全宣告失效等實際工作場景。參與者包括律所與內部律師、隱私合規人員、風險與金融顧問、法律學者及司法和公共部門代表。

Hugging Face blog● 精選10/2 11:19AI 評分70

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。

r/ClaudeAI top of the day10/3 13:49AI 評分63

Opus 5.5 全自動製作四年 AI 回顧影片

一位使用者僅向 Opus 5.5 提供創意、工作資料夾和音樂檔案,模型便自主完成了從調研到成片的全流程。它檢索了四年 AI 發展資料與素材,擷取文章和介面截圖,編寫 HTML 與動畫程式碼,用 Playwright 渲染畫面、FFmpeg 合成並加入音效,最終輸出完整影片。

OpenAI News● 精選10/6 06:00AI 評分67

OpenAI 用 Ironclad 合同任務訓練 GPT-6 Astra

OpenAI 公布與 AI 合同平台 Ironclad 的研究合作,GPT-6 Astra 成為首個用 Ironclad 任務訓練的前沿模型。雙方與 Ironclad 使用者共同定義了 11 項法律、商務與採購任務,如搭建保密協議、採購審批流程和可複用條款,每項任務熟練使用者約需 30 到 40 分鐘,評估標準為 8 到 50 條。

Hacker News front page10/5 15:22AI 評分45

數學家 Jeremy Avigad 談 AI 衝擊下的數學研究

數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。

TechCrunch AI10/8 14:20AI 評分37

Ben Affleck 講解 AI 技術走紅,談微調開源影片模型

Ben Affleck 本週因多段訪談影片走紅,他在其中講解神經網路、transformer、張量等概念,並稱自己會寫點 Python。他透露做法是拿開源模型微調:解凍權重、只訓練最後一層「電影感」層,讓劇組達到製片標準,該技術已用於其電影《Animals》後期。他創立的 AI 影視公司今年被 Netflix 收購,報導金額 5.87 億美元,他本人稱這個數字不準確。他還表示不擔心 AI 接管影視業,更擔心學生的習得性無助與大學 A 成績三年上升 30%。

Hacker News front page● 精選10/5 08:56AI 評分80

Altman 稱應接受 AI 壞處換取好處,主張輕監管

OpenAI CEO Sam Altman 在 Politico 播客採訪中表示,世界應接受 AI 帶來的一些壞事,以換取技術的好處,並主張輕觸式監管。他提到的例子包括駭客攻擊、詐騙等,並稱不會接受「零重大駭客攻擊、零濫用」這樣的交易。此番言論引發佛州州長 Ron DeSantis 與紐約大學教授 Gary Marcus 批評;

TechCrunch AI10/5 12:43AI 評分67

HackerRank 向客戶開放 AI 面試官 Chakra,已面試超 50 萬場

HackerRank 的 AI 面試 agent Chakra 結束約六個月 beta,週一起正式向企業客戶開放,測試期間已完成逾 50 萬場面試,Snowflake、Snorkel、Capgemini 等公司參與試用。候選人要在帶 AI 助手的畫布上處理真實程式碼倉庫任務,Chakra 會依據其操作追問思路,評估批判性思維、判斷力與「AI fluency」,即如何向 AI 描述問題、判斷其輸出並引匯出解法。

Hacker News front page10/4 04:41AI 評分35

Stripe 設計負責人談用 AI 避免殭屍 UI

Stripe 設計負責人 Katie Dill 在 2026 年 9 月 10 日舊金山 Lenny and Friends Summit 的演講中提出,AI 讓建置產品更容易,但產品容易淪為通用的殭屍 UI。她認為好設計仍取決於清晰的觀點、對使用者的理解和對細節的用心,並分享瞭如何把標準寫進 AI 工具、在初稿之外繼續編輯、用 AI 做出更原創的產品。該影片由 Lenny's Podcast 於 9 月 25 日發布,時長 21 分 47 秒。

OpenAI News10/1 13:00AI 評分38

OpenAI 平台發文:超級智慧最大價值或在枯燥工作

OpenAI 新平台發布系列首篇隨筆《永恆的互補》,作者為 Hemanth Asirvatham 與 Elliott Mokski,文末註明觀點不代表 OpenAI。文章引用 Nick Bloom 等研究:維持摩爾定律所需研究人員數量是 1970 年代初的 18 倍以上,1930 年代以來全經濟有效研究投入增長 23 倍,而研究生產率下降 41 倍。作者據此提出「制度智慧」概念,認為前沿智慧與執行能力互為補充,超級智慧的價值可能更多體現在重複性執行工作上。

Hacker News front page10/2 17:25AI 評分71

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。

TechCrunch AI10/8 14:10AI 評分74

OpenAI 發布 719 份數學解答,被指未達學界標準

OpenAI 本週發布 719 份針對高難度數學問題的解答,但未完全滿足普林斯頓高等研究院 AGMAI 上月發布的指南。AGMAI 的首要建議是停止在專有模型上測試高深數學問題,而 OpenAI 明確稱正用開放研究問題評估其專有模型;719 篇手稿中僅 10 篇公開了模型的思維鏈,42% 的證明未做形式化。

Google Developers blog10/8 18:10AI 評分60

Google Cloud 開源 AQuA,為生產環境 agent 做品質診斷

Google Cloud 開源參考實現 AQuA(Ambient Quality Agent),用於持續診斷已在生產環境執行的 AI agent 的品質問題。它與生產 agent 並排執行,掃描失敗聚類並對照對話記錄逐條驗證,再把根因定位到當時實際部署的原始碼快照。它針對的場景是:agent 做到 80% 之後難以繼續改進,且靜默的品質回退仍然返回 HTTP 200 OK。

X @GoogleDeepMind● 精選10/7 10:03AI 評分85

SynthID Detector 向所有人開放,可檢測多家 AI 生成內容

Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。

Hacker News front page10/7 04:00AI 評分45

Criteo 初級工程師:AI 時代真正的風險是永遠停在 Junior

在 Criteo 任職的初級工程師 Elise Baturone 認為,AI 不會讓軟體工程師消失,真正的風險是資深工程師消失、所有人永遠停在 Junior 階段。她把自己的 agent 調教成導師,用蘇格拉底式提問做理解檢查,並把「提問」和「review」當成需要自己練的技能:追問 agent 解釋設計選擇、引用來源、論證可疑方案,常能讓它自己發現錯誤。她承認這更費 token,但先弄懂再上線更省事;

Hacker News front page10/5 19:06AI 評分56

學者提出 Ephemeral Testing:用 AI 臨時搭建上層應用檢驗程式碼

魁北克大學電腦科學教授 Daniel Lemire 提出 ephemeral testing(臨時測試):不直接評估自己寫的程式碼,而是讓 AI agent 在其之上臨時搭建一層或多層應用並測試,用完即棄,再根據失敗情況反推底層程式碼品質。它屬於整合測試,區別在於上層軟體完全是一次性的;API 清晰、不變數穩定、報錯有用的庫能讓 agent 快速產出可執行的東西,隱藏狀態、意外預設值或文件不全的庫則會產出一堆補丁和失敗,這些失敗是底層程式碼的證據而非 agent 的問題。