7.1
深览指数
科技量子位··AI 生成

代码造世界,扩散绘现实:AgentGarten让智能体在实时试炼场中边玩边进化

MirroS团队提出AgentGarten框架,将可执行的代码环境(负责物理规则与状态判定)与实时神经渲染器(负责生成视觉反馈)结合,为智能体构建了一个可交互、可试错、可积累经验的闭环物理世界。在经典捉迷藏实验中,智能体通过逐轮复盘并撰写文字手册(自我反思),在数轮内(而非传统的千万至上亿局强化学习)涌现出搭建掩体、借坡道翻墙等策略。该框架揭示了让智能体在物理世界中持续自我进化的一种可能路径。原文 ↗

核心观点
  • ▍AgentGarten通过将物理规则交给代码环境、视觉生成交给神经渲染器的分工,为智能体提供了一个物理因果确定且视觉逼真的交互式训练场,使其能通过自我反思快速演化行为策略。
  • ▍该架构的核心闭环是:智能体在代码驱动的世界中行动并记录观察,神经渲染器实时生成视觉反馈,智能体在每轮结束后撰写经验手册,手册作为先验知识传递给后续智能体,实现经验积累与策略迭代。
  1. 01在捉迷藏实验中,智能体通过逐轮反思文字手册,躲藏者在第4轮学会搭建掩体封堵通道,搜寻者在第10轮掌握借坡道翻墙的策略。而在OpenAI 2019年的实验中,通过零基础强化学习学会这两项策略分别需要约2500万局和1亿局。
  2. 02AgentGarten的神经渲染器通过Adversarial Forcing训练、精确重放机制和真实视频对抗信号,以超过30fps的速率在单卡上生成480p分辨率的闭环交互画面,并解决了长程交互中画面漂移和伪影的问题。
  3. 03该框架在另外四个任务世界(陪伴小狗、狭桥会车、合作牧羊、采石场装载机)中进行了验证,经过四轮演练,各任务的表现均有显著提升,如狭桥会车总耗时从71秒降至41秒。
  4. 04智能体在探索过程中会生成结构化的“实验手册”,区分“观察到的现象”与“推断的猜测”,并包含防坑指南,例如“搬东西前先试拉一下,别把卡死当抓稳”。
  5. 05AgentGarten使得虚拟环境的构建从“美术劳动密集型”转为“代码程序化扩展型”,只需提供简单的三维深度和法线轮廓,即可复用神经渲染器生成拟真画面。
反方 / 局限
  • — 文章未提及该框架在更复杂、更开放的长尾任务(如家庭日常服务、工业制造)中的泛化能力和性能表现。
  • — 文中所有实验均基于模拟的虚拟环境,文中未讨论该架构或方法论从虚拟环境迁移到真实物理世界(Sim-to-Real)时所面临的挑战。
13 分钟 · 5 卡片 · 12 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问