7.7
深览指数
科技量子位·一水··AI 生成

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

文章指出具身智能当前瓶颈不在硬件,而在机器人大脑。主流VLA路线是即时反应系统,缺乏对后果的推演能力;接棒的世界模型也存在误差累积和缺乏“本体认知”两大缺陷。科大讯飞新成立的爻方智能提出了一条新路线:通过将逆运动学作为训练任务,让模型在预测世界的同时学会认识自身身体的物理极限,从而跨越实用门槛。文章适合关注具身智能技术路线之争、对世界模型和VLA架构有基础了解的从业者或研究者阅读。原文 ↗

核心观点
  • 当前具身智能的瓶颈在大脑,而主流VLA(视觉-语言-动作)模型本质是“即时反应系统”,缺乏对行动后果的预判能力,不是终局。
  • 接棒VLA的世界模型存在两个关键缺陷:一是“可执行性鸿沟”(预测画面与真实物理动作间的误差累积),二是缺乏“本体认知”——模型预判世界但不认识自己身体的物理极限。
  1. 01爻方智能提出的iFLYTEK-Embodied-Omni架构采用“双核大脑”:VLM(理解规划)+ VGM(视频生成预测未来状态)+ AGM(动作生成),通过共享自注意力机制实现大脑-小脑实时协同。
  2. 02为注入“本体认知”,爻方将逆运动学做成了训练任务本身:不给模型具体动作指令,只给要到达的目标位置,逼模型自己算出每个关节如何转动。
  3. 03在训练数据配比上,爻方近一半(49.11%)是2D/3D轨迹、定位、空间指向等“具身大脑数据”,而非昂贵的真机数据,旨在用有限数据最大化泛化能力。
  4. 04模型在LIBERO-Plus零样本基准上平均成功率89.6%,在RoboTwin 2.0双臂协同基准上(标准/随机环境)成功率超93%,且长时序任务中随机环境成绩反而更高。
  5. 05英伟达今年2月的DreamZero(GR00T 2底子)也已将预测画面和动作生成改为联合训练,与爻方方向一致,但英伟达的“本体状态”仅作为输入信号,而非训练任务。
  6. 06科大讯飞为此成立新公司“爻方智能”(注册资本3亿元),由国家科技进步一等奖主要完成人潘嘉带队,与科大讯飞子公司聆动通用分工协作:爻方出大脑,聆动负责本体和硬件。
反方 / 局限
  • “本体认知”在传统机器人学中已有“本体感知”概念(通过传感器感知关节角度/扭矩),爻方的创新更多在于将其作为端到端具身大模型的训练目标,而非发明了全新的概念。
  • 文章承认目前视频生成仍是用自回归+扩散模型,与自家架构契合才选择了该路线,将来是否迁移到其他技术路线并未定论,显示出该方案的技术路径存在阶段性。
16 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

平行视角

延伸追问