7.2
深览指数
科技微博·量子位··AI 生成
代码造世界:AgentGarten让智能体在实时试炼场中边玩边进化
MirroS团队发布的AgentGarten框架,将可执行的代码物理环境与实时神经渲染器结合,让AI智能体在超过30fps的交互世界中行动、试错并撰写“实验手册”沉淀经验。该框架在捉迷藏等五类任务中展示了远超传统强化学习的策略涌现效率——躲藏者第4轮学会搭掩体,搜寻者第10轮掌握借坡道翻墙。这是一条有别于纯游戏引擎与纯视频世界模型的第三条路径,适用于具身智能与通用智能体在物理世界中的持续进化研究。适合对前沿AI训练方法、具身智能、自我改进系统感兴趣的技术从业者与研究者。原文 ↗
核心观点
- ▍AgentGarten框架通过解耦「代码物理环境」(确定性规则)与「神经渲染器」(拟真视觉),为智能体提供了一个既能精准交互、又能低成本程序化扩展的实时试炼场,从而支撑智能体在物理世界中的递归自我改进(Physical RSI)。
- ▍智能体通过“读任务→盲盒试错→撰写手册→封存传代”的四步闭环,将探索经验沉淀为文本策略库,使策略涌现效率显著高于传统从零开始的强化学习:在捉迷藏实验中,AgentGarten智能体仅需4-10轮(约数万局)便能掌握经典博弈策略,而OpenAI 2019年的自我博弈研究需要数千万至上亿局。
- 01AgentGarten将动作指令传递给代码环境,计算物理碰撞与状态更新后导出几何草图(深度/法线),再由神经渲染器根据几何草图和视觉记忆实时生成下一帧画面,闭环绕行,吞吐超过30fps。
- 02在捉迷藏实验中,躲藏者第4轮学会搬挡板搭建掩体,搜寻者第10轮掌握借坡道翻墙。搜寻者在一次跳跃失败后,还会主动推近坡道、调整位置再次尝试。
- 03智能体每轮结束后会撰写“实验手册”,严格区分观察与猜测,并给后续智能体留下防坑指南,例如躲藏者总结“防守核心在于堵住通道而非挡住视线”,搜寻者建议“搬东西前先试拉一下,别把卡死当抓稳”。
- 04团队在另外四个世界(陪伴小狗、狭桥会车、合作牧羊、采石场装载机)各运行四轮演练,均展现出稳健的行为进化,例如狭桥会车双车总耗时从71秒压缩至41秒。
- 05神经渲染器通过流式逐块生成、精确重放机制、对抗训练(引入真实视频判别器)以及Triton融合算子/CUDA Graph等优化,解决了突发动作响应、长程交互漂移和实时性能三大问题,稳定支持480p/30fps以上的闭环交互。
反方 / 局限
- — 文章未明确讨论AgentGarten框架在部署时的计算成本:维持30fps以上的神经渲染需要高配GPU(文中未提及具体算力需求),这可能限制其在大规模智能体集群或资源受限设备上的应用。
- — 所有实验仅在4-10轮的短周期内验证,未涉及长期训练中手册策略库的膨胀管理、冗余缓存、或新旧策略冲突问题,长期可扩展性尚未证明。
10 分钟 · 5 卡片 · 8 资料
读原文 →