6.5
深览指数
科技微博·量子位··AI 生成

1.5B开源通用VLA模型,冲进具身智能第一梯队

面壁智能在WAIC期间发布了MiniCPM-Robot系列VLA模型,包括1.5B参数的操作模型和0.9B参数的跟踪导航模型,均开源。该系列在LIBERO等主流评测中进入第一梯队,关键差异化在于长上下文记忆能力(RMBench评分53分 vs π0.5的10分)和极低延迟(单帧推理120ms,约为π0.5的一半)。文章还介绍了配套的具身推理框架PhyAI以及与乐聚、吉利的合作案例。适合关注具身智能技术路线、小模型端侧部署的从业者和研究者阅读。原文 ↗

核心观点
  • 具身智能模型竞争正从单纯拼参数规模转向拼单位算力能换来的实际能力,1.5B/0.9B的小模型通过压缩视觉Token、流式计算和系统优化,在端侧本地即可实现接近或超越大模型的效果。
  1. 01MiniCPM-RobotManip参数量仅1.5B,在LIBERO、Calvin等主流VLA评测中进入第一梯队,与π0.5等模型处在相近水平。
  2. 02在RMBench长上下文记忆测试中,π0.5得分约10分(接近随机),MiniCPM-RobotManip得分约53分。
  3. 03在H100、bf16精度下,MiniCPM-RobotManip单次决策延迟约120ms,π0.5约234ms。
  4. 04MiniCPM-RobotTrack基于MiniCPM4-0.5B,参数规模0.9B,在单目标、多人干扰、模糊目标三类追踪任务中分别达到89.8%、73.4%和80.4%,均取得开源方案最优。
  5. 05在宇树Go2 Edu原装算力上,MiniCPM-RobotTrack端到端响应延迟约180ms,稳定帧率5Hz以上,拔网线后仍可正常工作。
  6. 06PhyAI推理框架在RTX 5090上对π0、π0.5、GR00T分别实现2.85倍、1.82倍、2.28倍加速。
  7. 07MiniCPM-RobotManip采用视觉Token压缩和流式计算,避免历史信息重算,使机器人能带着更长的历史执行任务而不导致计算量暴涨。
反方 / 局限
  • 文章承认,真实世界存在训练集里很少见的情况(目标横穿、快速转向、短时遮挡、多人交叉),这类场景数量少却最容易让模型翻车。
  • 清华大学姚远指出,现阶段不少机器人Demo围绕单一任务采集大量数据进行针对性优化,展示效果并不能完全代表基础模型真实进度。
  • 当前多数VLA基础模型都控制在4B以内,模型继续做大能带来多少真实操作收益,行业仍在验证。
11 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问