AISpot

搜尋

依意思最接近的 7 筆

機器之心● 精選10/5 12:28AI 評分68

SocioVerse2 發布:開源社會模擬框架支援干預與反事實分支

上海創智學院、復旦大學、倫敦國王學院與牛津大學等團隊發布開源社會模擬框架 SocioVerse2,把 LLM 社會模擬從截面問卷擴充套件為可干預的縱向過程。研究者在任意時間步插入干預,系統回放已記錄的動作生成反事實分支,分叉前人群、行為模型與隨機種子一致;研究過程則以可編輯的版本樹組織,每個版本儲存完整快照。

Hugging Face blog10/2 05:01AI 評分58

ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料

ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。

TechCrunch AI10/5 13:00AI 評分65

Safeworld 獲 1200 萬美元種子輪,為 AI 機器人做安全模擬

Safeworld 結束隱身狀態,宣布由 Shine Capital 與 a16z Speedrun 領投、Box Group、卡內基梅隆大學捐贈基金等參投的超 1200 萬美元種子輪。該公司由 CMU Safe AI 實驗室主任 Ding Zhao 與 Kyle Wong、Simo Rachidi 創立,做法是在 Genesis、MuJoCo 等模擬環境中接入待評估機器人的真實控制軟體,跑數千個真人模型與機器人相遇的場景,檢驗工廠盲區碰撞、跌倒、搬運等邊緣情況。

機器之心● 精選10/5 12:40AI 評分72

新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半

VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。

X @GoogleDeepMind10/1 18:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。