SocioVerse2 發布:開源社會模擬框架支援干預與反事實分支
上海創智學院、復旦大學、倫敦國王學院與牛津大學等團隊發布開源社會模擬框架 SocioVerse2,把 LLM 社會模擬從截面問卷擴充套件為可干預的縱向過程。研究者在任意時間步插入干預,系統回放已記錄的動作生成反事實分支,分叉前人群、行為模型與隨機種子一致;研究過程則以可編輯的版本樹組織,每個版本儲存完整快照。
找到 18 筆
上海創智學院、復旦大學、倫敦國王學院與牛津大學等團隊發布開源社會模擬框架 SocioVerse2,把 LLM 社會模擬從截面問卷擴充套件為可干預的縱向過程。研究者在任意時間步插入干預,系統回放已記錄的動作生成反事實分支,分叉前人群、行為模型與隨機種子一致;研究過程則以可編輯的版本樹組織,每個版本儲存完整快照。
NVIDIA 發布一批案例,展示開發者用 GPT-6 Astra、Claude Fable 5 等前沿模型驅動 Omniverse 庫完成模擬開發。開發者以自然語言下指令,由模型連線 ovphysx 物理、ovrtx 渲染與感測器模擬等庫,再人工稽核並逐步修正結果。
開發者 @gruberbuilds 用 Claude 建置了一個基於物理的奧尼爾圓柱體空間棲息地模擬,可在瀏覽器中漫遊。該圓柱寬 6.4 公里、長 32 公里,位於地月 L5 點,每 113.5 秒自轉一週,陽光來自反射鏡,重力來自旋轉。頁面需 WebGPU 支援,若瀏覽器未提供圖形介面卡,需在 Chrome 或 Edge 中開啟硬體加速並重啟。
OpenAI 開發者官方帳號 @OpenAIDevs 放出一款生活模擬小遊戲,遊戲角色是 DevDay 會後派對的嘉賓。該帖只有這一句介紹,未說明玩法、上線平台或獲取方式。
Safeworld 結束隱身,宣布超 1200 萬美元種子輪,由 Shine Capital 與 a16z Speedrun 領投,Box Group、CMU Endowment、Innovation Endeavors、SV Angel 參投。
Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。
一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。
馬斯克在社交平台發文,稱將超級智慧傳播到星際是生物載入程式的一種成功條件。該表述延續其此前把人類比作數字超級智慧“生物載入程式”的類比,未給出具體技術方案、時間表或涉及的公司與產品。
Google 旗下 Envisioning Studio 與 Google Labs 合作,在紐約時裝週前用 AI 創作工具 Google Flow 為設計師 Jane Wade 和 Sergio Hudson 各定製了一款工具。Jane 的 Styling Suite 可在數字模特上搭配發型、妝容、配飾與服裝,替代通常耗時最多三天的線下試裝;Sergio 的 Runway Visualization 可模擬秀場、更換燈光與道具並調整模特走位,控制預算。
一位傢俱廠運營總監用 Claude Code 在一個月內做出生產管理 Web 應用,已供辦公室和車間日常使用。成果包括各部門排產看板、批次計劃、採購跟進、產能模擬等,共 386 次提交、約 17.5 萬行 Python 與原生 JS、約 2100 個測試、580 個 API 路由、280 張 SQLite 表,技術棧為 FastAPI + SQLite + HTML/JS,跑在廠內 Windows 機器上。
Mistral 為一家歐洲能源運營商將 4 萬行 Fortran 77 編寫的油藏模擬器遷移到 C++,該程式碼庫沒有測試套件和集中文件。做法是先建置數值一致性校驗框架,再用 Vibe CLI 排程上百個 agent 逐節點生成文件並提交 PR,由審查 agent 定時複核。首次嘗試讓 agent 完全自主翻譯,結果只是把 Fortran 按 C++ 語法重寫,COMMON 塊和 GOTO 控制流原樣保留,未實現真正的現代化重構。
Mistral 於 2026 年 9 月 28 日在慕尼黑開設新中心,組建專注 Physics AI 與工業 AI 的研究團隊,並派駐應用工程師服務企業客戶。該中心將推進與 BMW 的碰撞模擬、與 Siemens Energy 的工業 AI 合作,並與慕尼黑工業大學共建汽車空氣動力學數字孿生研究。Mistral 計劃到 2030 年建成 1 吉瓦歐洲算力,其開放權重模型可部署在客戶自有基礎設施上。
智譜 AI 的 GLM-5.3 具備自主建置端到端網路漏洞利用的能力,水平接近 Claude Mythos Preview:在 ExploitBench 的 410 次嘗試中成功 50 次,在內部二進位制利用基準中 4% 的試驗實現完整控制流劫持。該模型未設有效防護,模擬測試中攻擊者可用簡單技術繞過其防護的比例達 64% 至 100%,而受防護的 Claude 模型未被攻破。
Anthropic 於 10 月 2 日推出 Claude Frontier Academy,投入 1 億美元,計劃到 2027 年底培訓 1 萬名 Frontier Deployed Engineer(FDE)。首批學員來自埃森哲、貝恩、凱捷、澳洲聯邦銀行、德勤、麥肯錫、摩根士丹利、諾和諾德等企業,在舊金山、紐約和倫敦開班。專案採用提名制,先參加數天線下培訓與模擬企業部署考核,通過後進入 12 周駐留期,在本組織內主導真實 Claude 用例,結業再考核,首批 FDE 認證預計 2027 年初頒發。
研究團隊與淘寶天貓合作推出 E-Commerce Bench,讓模型以商家身份在模擬市場中經營網店一整年。智慧體初始資金 10 萬元,可同時開多家店,在每天 600 分鐘的時間預算內完成選品、與供應商砍價、定價上架、管理庫存與現金流等決策。環境基於 6,886 個商品、60 個類目、576 家供應商和 12 種店鋪型別,需求與供應商報價由確定性核心計算,避免隨機噪聲和越獄砍價。評測從利潤、現金流、談判、防欺詐、效率、執行力和長期學習七個維度打分。
舊金山成立兩年的 Mirror Particle 認為用 LLM 角色扮演目標人群來預測人類行為的方法行不通,改為從零訓練模擬人類動因、並追蹤其隨時間變化的世界模型。它結合客戶資料、時事、流行文化與社交媒體建模人群,重點看真實發生的「已顯現行為」而非問卷自述。公司已完成天使輪、接近敲定首輪風投,將參加 TechCrunch Disrupt 2026 的 Startup Battlefield 200。初期面向市場研究與品牌產品策略;
馬斯克在 X 上發文稱,足夠大的數量本身就是一種品質。他以細胞作類比:細菌只有一個細胞,人類有 35 萬億個細胞,兩者都由細胞構成,但差異巨大。該帖未提及具體產品或公司,僅表達這一觀點。
Wolfram 於 2026 年 9 月 28 日發文,回應 AI 不斷解出數學題後“是否還需要人類做數學研究”的討論。他認為現代 AI 的最大價值在於挖掘人類數學知識庫並建立連線,但純數學的核心是引導提問的人類想像力;計算則能通過計算不可約性不斷生成全新結果。他以 1988 年 Mathematica 問世時類似的擔憂作類比,指出工具只是提升了可做的數學層次。