7.4
深览指数
科技量子位··AI 生成
全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源
本文介绍了一项由大晓机器人、南洋理工大学 S-Lab 和上海人工智能实验室联合提出的新研究 HSImul3R,该研究被 ECCV 2026 接收。其核心创新在于提出了一个“物理闭环”双向优化框架,将重力稳定性、真实接触等物理标准引入三维重建,解决了传统方法“视觉上成立但物理上无法交互”的痛点。文章通过具体实验数据展示了该框架在人-场景交互稳定率和穿模率上的显著提升,并展示了通过 Unitree G1 人形机器人实现“从视频到物理执行”的完整链路。适合关注具身智能、空间智能、三维视觉与机器人技能学习的研究者与从业者阅读。原文 ↗
核心观点
- ▍传统的人-场景三维重建仅停留在“视觉正确”,而 HSImul3R 提出了“物理成立”的新标准,即重建结果必须能在物理仿真中保持稳定的交互关系,从而将人类视频转化为机器人可直接学习的技能资产。
- ▍HSImul3R 提出的“物理闭环”双向优化框架,让物理仿真器从最终检验工具变为重建过程中的主动监督者,同时优化人体运动与三维场景。
- 01HSImul3R 在 HSIBench 的 Easy、Medium、Hard 三档任务中,人-场景交互稳定率分别达到 53.68%、30.56% 和 13.92%,显著高于基线方法 HSfM 的 10.52%、4.50% 和 2.66%。
- 02HSImul3R 将人-场景三维穿模率从 HSfM 的 69.51% 大幅降至 22.90%。
- 03通过“面向场景的强化学习”优化人体运动,使其在物理可行的同时,能够与特定场景保持正确的接触关系,而非仅仅复现一个抽象的动力学轨迹。
- 04通过“直接仿真奖励优化”利用物理仿真的交互结果反向优化三维物体生成模型,评价标准从“物体自己能否站稳”提升到“人与它交互后还能否稳定”。
- 05团队将优化后的人体动作迁移至 Unitree G1 人形机器人,实现了从视频到三维重建、到物理仿真优化、再到真实机器人执行的完整 Sim-to-Real 链路。
- 06团队构建了 HSIBench 基准数据集,包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例,将人-场景交互稳定性作为核心评价指标。
反方 / 局限
- — 作者明确表示,这条路线仍处于早期阶段,复杂交互、多物体场景和动态环境依然存在大量挑战。
11 分钟 · 4 卡片 · 10 资料
读原文 →