8.1
深览指数
科技人人都是产品经理·Z Finance··AI 生成
专访 NVIDIA Cosmos Max Li:为什么Action必须成为预训练的一部分?Physical AI的底层逻辑正在重写
NVIDIA Cosmos 团队核心成员 Max Li 认为,Physical AI 的下一个关键突破在于将 Action 作为预训练数据的一部分,而非仅在后期微调阶段加入。他提出,一个能理解世界的模型必须同时理解行动及其后果,为此 Cosmos 正从视频生成模型演进为融合 video、text、audio、action 的统一多模态世界模型。访谈详细拆解了从 3D 仿真转向视频生成的技术路线变迁、统一模型在理解与生成能力上的工程取舍(MoT 架构),以及跨 embodiment 的 action representation 设计思路。适合对世界模型、具身智能前沿技术路线及 NVIDIA 开源战略感兴趣的读者。原文 ↗
核心观点
- ▍Action 应成为预训练(pre-training)的核心组成部分,而非仅在 post-training 阶段优化,因为 AI agent 需要理解行动的后果才能改变世界。
- ▍Cosmos 的目标是构建一个统一的多模态基础模型(Omni Model),将 video、text、audio、image 和 action 在同一个表示空间中对齐,以推动 Physical AI 的泛化能力。
- 01Max Li 提到,从 2B 到 8B 模型规模时观察到了能力涌现(从“无法工作”到“突然有效”),而 8B 到 32B 则更多是减少生成瑕疵。
- 02实验表明,在 8B 的 dense 模型中加入 action 模态后,视频生成质量几乎未下降,表明模型具备很强的参数效率,能同时学习多种模态。
- 03Cosmos 3 采用 MoT(多模态专家)架构,针对不同模态特点设计:text 用 autoregressive,video、audio、action 用 diffusion/flow matching,以降低第一代 omni model 的训练风险。
- 04团队观察到,更强的理解能力(VLM/Reasoner)能显著提升生成能力(generation),但反向的促进关系尚未得到明确实验验证。
- 05Max Li 认为,跨 embodiment 的 action representation 应该关注高层任务目标(如“向前移动 10 厘米”),而非具体执行方式,类似于传统机器人控制中的 high-level controller。
反方 / 局限
- — Max Li 承认,MoT 架构虽然工程上更稳健,但由于不同模态共享参数有限,可能会限制它们在 latent space 中深层次融合的能力;长期来看更理想的方案是更简单的统一模型。
- — 关于 long context 和 memory,Max Li 指出,当前机器人和自动驾驶领域连短期任务的可靠性都未完全解决,因此 long context 尚未成为最紧迫的问题,但未来不可避免。
Max LiNVIDIA CosmosPhysical AIWorld ModelMoT (Mixture of Tokens)Action RepresentationEmbodimentDeepSeek R1Sora
49 分钟 · 3 卡片 · 6 资料
读原文 →