7.5
深览指数
科技量子位·鱼羊··AI 生成
3万小时触觉数据补齐具身智能“手感”!新智具身&复旦报告三连发
上海新智具身(NeoteAI)与复旦大学联合发布 N0 系列三份技术报告,聚焦具身智能的触觉感知。核心是构建了 3 万小时视觉-触觉交互数据集,并提出两条技术路线:N0-VTLA 通过预测未来触觉演变,将插插头任务成功率从 60% 提升至 85%;N0-TWAM 则将触觉纳入世界模型,使机器人能“想象”操作手感,仿真平均成功率从 36% 跃升至 84.5%。报告论证了触觉从辅助模态升格为具身智能核心基建的潜力,数据和模型已开源。适合关注具身智能前沿技术、VLA 架构演进、机器人数据工程的从业者阅读。原文 ↗
核心观点
- ▍触觉反馈是阻碍机器人跨越物理交互“最后一厘米”的核心痛点,NeoteAI 验证了触觉模态具备类似视觉的 Scaling 潜力,应从“辅助模态”跃升为“核心基建”。
- ▍NeoteAI 提出了两条技术路线解决触觉融入 VLA 架构的问题:N0-VTLA 通过预测未来触觉演变实现“预判”;N0-TWAM 将触觉纳入世界模型,进行“触觉想象”推演。
- 01NeoData 数据集包含超 3 万小时视觉-触觉交互操作数据,约 140 万条操作片段,33 亿个时间步,对应 80 亿帧 RGB 画面与 100 亿帧触觉图像,覆盖 450 项真实长程任务。
- 02NeoForce 统一表征模型能将不同传感器输出的凝胶形变图、电容矩阵或六维力向量等“方言”转化为统一的“触觉普通话”,解决跨设备数据融合难题。
- 03N0-VTLA 在插插头任务中成功率达 85%,而同类视觉方案仅 60%;在拔钥匙的任务成功率达 99%,而视觉方案为 35%。
- 04N0-VTLA 结合触觉信息与离线强化学习,使机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率,分别从 50%、35%、20% 大幅跃升至 95%、80%、75%。
- 05N0-TWAM 采用混合专家架构,总参数量 72 亿,在仿真中平均成功率达 84.5%,而世界模型最强基线为 36%;真机 8 项任务平均成功率 46.3%,LingBot-VA 为 21.9%。
- 06消融实验证实,去除“未来触觉预测”或“当前触觉条件”均会导致 N0-TWAM 性能显著下降,确立了触觉在世界模型中的不可或缺性。
- 07项目已开源 5 千小时视觉-触觉交互操作数据,并提供了完整项目链接:https://research.neoteai.com
反方 / 局限
- — 文章承认,真实场景下的数据采集成本、跨本体泛化能力以及推理实时性,仍是触觉泛化至通用具身智能的工程难题。
8 分钟 · 3 卡片 · 7 资料
读原文 →