AISpot

搜尋

依意思最接近的 8 筆

Hugging Face blog10/3 23:56AI 評分55

微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

r/LocalLLaMA top of the day10/2 23:18AI 評分18

愛爾蘭公立學院獲資助建小型 AI 實驗室,發帖徵集教學內容

愛爾蘭一所公立繼續教育學院(相當於美國的社群學院)拿到資助,建起了一個小型 AI 實驗室,硬體條件還算不錯。發帖人向更有經驗的人徵集教學思路,目標是讓學生獲得使用 ChatGPT 之外的實用技能。帖子本身只提出征集,沒有給出課程方案、招生規模或具體裝置型號等細節。

Hugging Face blog10/2 05:01AI 評分46

ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。

X @GoogleDeepMind10/1 18:11AI 評分42

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容逼真化後如何驗證內容來自人類、機器還是自然,核心手段是來源溯源與不可感知水印。節目時間軸顯示內容涵蓋水印定義、SynthID、影像與影片、SynthID Bio 以及未來韌性,其中 SynthID 部分從 4 分 35 秒開始,SynthID Bio 從 19 分 28 秒開始。

Ars Technica AI10/1 17:28AI 評分58

AI Ataraxos 以 15 比 1 擊敗 Stratego 人類頂尖選手

卡內基梅隆、MIT、紐約大學與斯坦福的團隊訓練出的 AI Ataraxos,在不完全資訊棋類 Stratego 上以 15 勝 1 負 4 平擊敗頂尖棋手 Pim Niemeijer,訓練只用 16 塊 GPU、花費幾千美元。此前連 DeepMind 也沒能做出穩定戰勝人類頂尖選手的機器。它與撲克一樣屬於不完全資訊遊戲,每方 40 枚棋子,身份只有碰撞交戰時才揭示,隱藏資訊量極大且展開時間很長。