AISpot

搜尋

依意思最接近的 6 筆

Hugging Face blog10/2 05:01AI 評分46

ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。

Hugging Face blog10/3 23:56AI 評分55

微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

The Verge AI10/3 16:00AI 評分21

Splice CEO 稱 AI 郵件正在扼殺對話

Splice CEO Kakul Srivastava 認為 AI 生成的郵件正在扼殺對話。她此前在 Flickr、Yahoo、GitHub 和 Adobe 擔任高管,如今領導這家為音樂製作人提供 one-shot 與旋律 loop 的取樣平台,其取樣曾被 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》等熱門歌曲使用。她還主導收購了 Spitfire Audio,並推動平台向更多領域拓展。

X @GoogleDeepMind10/1 18:11AI 評分42

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容逼真化後如何驗證內容來自人類、機器還是自然,核心手段是來源溯源與不可感知水印。節目時間軸顯示內容涵蓋水印定義、SynthID、影像與影片、SynthID Bio 以及未來韌性,其中 SynthID 部分從 4 分 35 秒開始,SynthID Bio 從 19 分 28 秒開始。