7.3
深览指数
科技虎嗅·经观感知©··AI 生成

Google升级机器人“大脑”2.0,机器人终于知道自己干到哪一步了

Google 悄然发布了新一代具身推理模型 Gemini Robotics ER 2,不再追求“包办一切”的端到端机器人控制,而是将自身定位为机器人的“高层大脑”或中间件,负责任务拆解、视频进度理解和多机协同调度。文章指出,这比直接推出人形机器人更具商业野心,旨在让 Gemini 成为机器人产业的“Android”。对于中国具身智能企业,通用模型能力可外购后,其真正的壁垒应从“自研模型”转向场景数据与工程落地能力。原文 ↗

核心观点
  • Google 对机器人产业的战略定位是“连接者”,通过提供通用的“高层大脑”推理模型(如 ER 2),而非自主生产人形机器人,来占据机器人生态的软件入口,复现 Android 在手机时代的成功路径。
  • ER 2 模型的核心升级在于从“静态任务规划”走向“持续执行循环”,能够理解视频流中的动作进度,判断任务是否完成,从而补上机器人规划与执行之间脱节的关键一环。
  1. 01Google 将 Gemini Robotics 分为两层:VLA 模型负责“手脚怎么动”(动作执行),ER 模型(具身推理)负责“接下来该做什么”(任务拆解、环境理解、工具调用和高层调度)。
  2. 02ER 2 模型建立在 Gemini 3.5 Flash 之上,新增了视频片段定位、任务进度分类、多机器人协同以及多步骤工具调用能力。
  3. 03Google 推出了流式模型端(streaming-preview),通过 Live API 持续接收音视频流,支持低延迟函数调用,使机器人能保持与环境的连续感知。
  4. 04ER 2 的输出仍为文本(坐标、边界框、指令),不直接输出电机控制信号,需要与开发者自己的 VLA 模型、抓取模型、运动控制器等硬件接口连接,证明了其“中间件”定位。
  5. 05官方已展示 ER 2 可适配 ALOHA 双臂平台、Franka 机械臂及 Apptronik Apollo 人形机器人,强调面向“不同形状和尺寸”的机器人。
  6. 06文章指出,ER 2 试图解决当前工业场景中“设备难以灵活协同,无法低成本处理频繁变化任务”的痛点,而非仅追求人形机器人炫目的单项动作。
反方 / 局限
  • Google 官方文档承认模型存在局限:复杂请求和高分辨率输入会增加延迟;模型可能产生幻觉;空间输出受光照、对比度影响;高精度任务建议多次调用取平均值。
  • ER 2 目前仍处于预览阶段,缺乏公开的完整基准测试和真实商业场景长期运行数据,其在连续工作、陌生环境下的稳定性尚待验证。
  • 流式视频接入引发了新的数据隐私问题,工厂等敏感场景的客户是否愿意将生产视频和任务数据送入外部模型,将直接影响 ER 2 的商业化速度。
  • 文章隐含地挑战了中国具身智能企业“全栈自研”的叙事,暗示当通用模型能力可外购时,企业真正的壁垒可能在于本体、工程和数据场景,而非“自研模型”这个标签本身。
11 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问