AISpot

搜尋

依意思最接近的 6 筆

量子位● 精選10/5 05:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

Hacker News front page10/6 00:06AI 評分56

學者提出 Ephemeral Testing:用 AI 臨時搭建上層應用檢驗程式碼

魁北克大學電腦科學教授 Daniel Lemire 提出 ephemeral testing(臨時測試):不直接評估自己寫的程式碼,而是讓 AI agent 在其之上臨時搭建一層或多層應用並測試,用完即棄,再根據失敗情況反推底層程式碼品質。它屬於整合測試,區別在於上層軟體完全是一次性的;API 清晰、不變數穩定、報錯有用的庫能讓 agent 快速產出可執行的東西,隱藏狀態、意外預設值或文件不全的庫則會產出一堆補丁和失敗,這些失敗是底層程式碼的證據而非 agent 的問題。

Hugging Face blog10/2 05:01AI 評分58

ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料

ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。

Hacker News front page● 精選10/6 18:01AI 評分80

猶他州啟動全美首個 AI 獨立問診開藥試點

猶他州推出全美首個由 AI 獨立完成問診與開藥的試點專案,無需醫生直接監督。患者訂閱 Nolla Health 每月 4.99 美元的應用並掃描面部,AI 結合病史與個人資訊給出痤瘡嚴重度評分,從八種獲批外用藥物中推薦方案。試點為期一年,僅限輕中度痤瘡:前 100 張處方由醫生稽核,隨後 400 張改由 AI 直接提交藥房、醫生每週回溯,最終階段每月抽查至少 10% 的處方。

X @GoogleDeepMind10/1 18:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。