6.9
深览指数
科技量子位··AI 生成
世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型
这是智在无界(BeingBeyond)对其具身基础模型 Being-H0.8 的详细技术解读,核心突破是首次将触觉模态纳入隐式世界-动作模型,形成「预测-执行-反馈」的完整闭环。文章完整披露了模型架构(MoT、慢-快动作专家、通用触觉编码器、TopoHand)以及数据 pipeline(从50万小时第一人称视频中,通过TactoHand恢复接触、压力手套补充、通用触觉编码器统一表征、TopoHand对齐动作空间)。适合关注具身智能、机器人精细操作、世界模型技术路线的研发者及投资从业者深度阅读,文章信息密度高,技术细节完整,但属于典型的公司技术宣发,缺乏独立第三方评估和与竞品路线的对比。原文 ↗
核心观点
- ▍Being-H0.8 首次将触觉模态纳入隐式世界-动作模型,让机器人不再仅凭视觉预测,而是在隐空间中预判接触后果,并利用触觉反馈实时调整动作,形成「预测-执行-反馈」闭环。
- 01模型由四个核心模块组成:负责预测交互后果的 Mixture of Transformers (MoT)、负责执行与实时调整的慢-快动作专家、负责统一触觉输入的通用触觉编码器,以及负责统一人手与机器人动作空间的 TopoHand。
- 02数据底座汇集了超过50万小时、来自数十家合作伙伴的第一人称视频数据,经清洗、动作恢复、触觉标注和表征统一后,形成高质量训练数据集 UniHand-3.0。
- 03TactoHand 模型利用手与物体的三维几何关系,从无触觉标注的人类视频中预测稠密的伪触觉监督(接触标注和邻近度标注),使用21个人-物交互数据源、共计3010万帧数据进行训练。
- 04UniHand-3.0 还加入了约55小时、540万同步帧的压力手套数据,以补充物理压力信息,与大规模人类视频形成互补。
- 05在真实双臂机器人实验中,Being-H0.8 完成了包中取物、毛笔写字、挤牙膏、夹薯片等依赖触觉的高难度精巧任务。
反方 / 局限
- — 文章为典型技术宣发,缺乏独立第三方评估,也未与李飞飞、宋舒然等团队在触觉世界模型方向的同类工作做直接对比,难以判断其真实领先幅度。
- — 文章未讨论触觉传感器在真实物理世界中的噪声、耐久性、校准成本等工程化落地难题,也未说明从伪触觉到真触觉的迁移效率。
BeingBeyond(智在无界)Being-H0.8卢宗青TactoHandUniHand-3.0TopoHandMixture of Transformers (MoT)通用触觉编码器MANOHMR
15 分钟 · 4 卡片 · 7 资料
读原文 →