MirroS 發布 AgentGarten:程式碼建世界加 30fps 神經渲染,智慧體數輪學會捉迷藏
MirroS 團隊發布 AgentGarten,把可執行程式碼環境與即時神經渲染器接成閉環:物理規則由程式碼裁定,畫面由模型以 480p、30fps 以上流式逐塊生成,智慧體因此能邊行動邊看結果。重做的捉迷藏實驗中,躲藏者第 4 輪學會搬擋板搭掩體、搜尋者第 10 輪學會借坡道翻牆,而 OpenAI 2019 年的自我博弈強化學習分別用了約 2500 萬局和 1 億局。智慧體靠每輪復盤寫下文字「實驗手冊」傳給下一輪,另在陪伴小狗、狹橋會車、合作牧羊、採石場裝載機四個任務中各跑四輪;程式碼已在 GitHub 開源。
給出可執行程式碼世界與即時神經渲染耦合的具體做法與實測資料:數輪內復現捉迷藏策略,對照 2019 年數千萬至上億局自我博弈,對做具身智慧與世界模型的研究者最有用。
原標題:代码造世界,扩散绘现实:AgentGarten让智能体在实时试炼场中边玩边进化
閱讀原文
| 評分 | 73 / 72(平均 72,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
微軟發布 4B 程式設計智慧體模型 FrogNano
微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。
Google 發布 Gemini Agent 辦公智慧體,底層可呼叫 Claude
Google 發布通用辦公智慧體 Gemini Agent,可長期雲端執行,自己查資料、寫郵件、做 PPT、分析資料並跨應用規劃任務。它擁有獨立企業身份,配專屬 Workspace 帳號、信箱、日曆和 Drive 空間,可被同事拉進群聊或在文件中 @。底層支援多模型編排與 Smart Routing,能在 Gemini 與 Anthropic 的 Claude 之間按效果、速度和成本動態選擇,未來計劃支援更多閉源與開源模型。
Berth:合上筆記本,Claude Code 等 agent 仍在開發機上跑
Berth 是一款開源 macOS 應用,讓 Claude Code、Codex 等 coding agent 跑在自有開發機上,合上筆記本仍繼續工作,早上開啟即可看到結果。按 ⌘N 說出需求,Berth 會在選定機器上建立 worktree 並啟動 agent,命令與讀取摺疊成一行、編輯以 diff 呈現,Claude 提問可就地作答;兩個 worktree 可分色分組並排對比聊天、diff 與終端。
Google 等提出 RRSI,給 Agent 自進化加正則化
Google 等提出 RRSI,用正則化約束 Agent Harness 的遞迴自我改進(RSI):不鎖死自我修改能力,而是限制每輪同時修改的機制數量、保留進化歷史,並在篩選階段剔除 benchmark-specific 改動和落在噪聲範圍內的漲分。
Latent Space 專訪 MIT Alex Zhang:談 RLM 與 agent 叢集
Latent Space 播客本期嘉賓為 MIT 的 Alex Zhang,他是 Recursive Language Models(RLM)的作者,也是 GPU Mode 社群成員。