5.7
深览指数
科技Bestblogs·Steven Hansen··AI 生成
Gemini Robotics ER 2 发布
Google DeepMind 发布了专为机器人设计的具身推理模型 Gemini Robotics ER 2,作为机器人的“高级大脑”,它通过连续视频流理解、实时任务编排和多机器人协作,使机器人能稳健执行多步骤任务。该模型在进度分类(准确率57.4%)和时刻查找(准确率91.3%)基准上达到SOTA,并显著提升了安全性能,能在人类靠近时自动停止。模型已通过Gemini API公开,并附有开源示例,开发者可立即上手构建机器人应用。原文 ↗
核心观点
- ▍Gemini Robotics ER 2 是一个专为机器人设计的物理智能体模型,利用连续视频输入作为核心感知手段,来编排、监控和纠正机器人的多步骤动作,实现端到端的具身推理。
- 01该模型在进度分类任务上达到57.4%的准确率,在精确时刻查找任务上达到91.3%的准确率和0.96秒的平均绝对距离,以较低计算成本媲美更大模型。
- 02支持多机器人协作:不同机器人(如轮式探测车、人形机器人)可通过共享语义理解相互通信并交接任务,完成单个机器人无法独立完成的工作流程。
- 03在安全指令遵循和人类接近度基准上取得最佳性能,可在人类靠近时自动停止人形机器人,并在区域清空后恢复运行。
- 04与Gemini Live API集成,实现低延迟双向流式传输,使机器人能够流畅执行多步骤任务,无需在步骤间停止思考。
- 05具备增强的空间推理能力:包括视频成功/失败检测、跨10种仪表类型的通用仪表读数,以及改进的视觉问答。
- 06模型通过Gemini API、Google AI Studio公开获取,并在GitHub上提供开源示例,可使用VLA和导航API等低级控制接口。
反方 / 局限
- — 虽然文章提到模型性能,但未涉及具体失败案例或局限性,例如在极端复杂场景或低光照、遮挡情况下的表现,以及计算资源消耗的具体数据。
Google DeepMindGemini Robotics ER 2Gemini APIGemini Live APIGoogle AI StudioGemini Enterprise Agent PlatformSteven Hansen
4 分钟 · 4 卡片 · 9 资料
读原文 →