科技量子位··AI 生成
代码造世界,扩散绘现实:AgentGarten让智能体在实时试炼场中边玩边进化
MirroS团队提出AgentGarten框架,将可执行的代码环境(负责物理规则与状态判定)与实时神经渲染器(负责生成视觉反馈)结合,为智能体构建了一个可交互、可试错、可积累经验的闭环物理世界。在经典捉迷藏实验中,智能体通过逐轮复盘并撰写文字手册(自我反思),在数轮内(而非传统的千万至上亿局强化学习)涌现出搭建掩体、借坡道翻墙等策略。该框架揭示了让智能体在物理世界中持续自我进化的一种可能路径。原文 ↗原文 ↗
核心观点
- ▍AgentGarten通过将物理规则交给代码环境、视觉生成交给神经渲染器的分工,为智能体提供了一个物理因果确定且视觉逼真的交互式训练场,使其能通过自我反思快速演化行为策略。
- ▍该架构的核心闭环是:智能体在代码驱动的世界中行动并记录观察,神经渲染器实时生成视觉反馈,智能体在每轮结束后撰写经验手册,手册作为先验知识传递给后续智能体,实现经验积累与策略迭代。
- 01在捉迷藏实验中,智能体通过逐轮反思文字手册,躲藏者在第4轮学会搭建掩体封堵通道,搜寻者在第10轮掌握借坡道翻墙的策略。而在OpenAI 2019年的实验中,通过零基础强化学习学会这两项策略分别需要约2500万局和1亿局。
- 02AgentGarten的神经渲染器通过Adversarial Forcing训练、精确重放机制和真实视频对抗信号,以超过30fps的速率在单卡上生成480p分辨率的闭环交互画面,并解决了长程交互中画面漂移和伪影的问题。
- 03该框架在另外四个任务世界(陪伴小狗、狭桥会车、合作牧羊、采石场装载机)中进行了验证,经过四轮演练,各任务的表现均有显著提升,如狭桥会车总耗时从71秒降至41秒。
- 04智能体在探索过程中会生成结构化的“实验手册”,区分“观察到的现象”与“推断的猜测”,并包含防坑指南,例如“搬东西前先试拉一下,别把卡死当抓稳”。
- 05AgentGarten使得虚拟环境的构建从“美术劳动密集型”转为“代码程序化扩展型”,只需提供简单的三维深度和法线轮廓,即可复用神经渲染器生成拟真画面。
反方 / 局限
- — 文章未提及该框架在更复杂、更开放的长尾任务(如家庭日常服务、工业制造)中的泛化能力和性能表现。
- — 文中所有实验均基于模拟的虚拟环境,文中未讨论该架构或方法论从虚拟环境迁移到真实物理世界(Sim-to-Real)时所面临的挑战。
13 分钟 · 5 卡片 · 12 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问