5.7
深览指数
科技Bestblogs·Carolina Parada··AI 生成

Gemini Robotics 2 为机器人带来全身智能

Google DeepMind 发布了 Gemini Robotics 2 升级版,包含三个核心模型,分别负责全身控制、具身推理和设备端部署。这套系统让机器人能实现从脚到指尖的全身智能运动、灵巧操作和多机器人协作,并强调了安全性。对于关注 AI 和机器人技术落地、具身智能前沿的读者,这是一篇来自官方的技术能力宣示。原文 ↗

核心观点
  • Gemini Robotics 2 是 Google DeepMind 在机器人智能栈上的重大升级,通过视觉-语言-动作模型实现机器人的全身智能、灵巧操作和多步骤任务规划。
  1. 01Gemini Robotics 2 VLA 模型实现了从脚到指尖的完整人形控制,使 Apptronik 的 Apollo 2 机器人能在杂乱环境中行走、下蹲、伸展和操作物体。
  2. 02Gemini Robotics ER 2 作为高级大脑,能解读指令、规划持续数分钟的序列,并协调不同类型机器人协作完成复杂工作流。
  3. 03设备端模型 Gemini Robotics On-Device 2 可在短短几小时内,使用少于 200 个示例适应新的机器人形状和传感器配置。
  4. 04新基准 ASIMOV-Agentic 用于衡量对不安全工具的拒绝和不确定性处理能力,提升安全性。
反方 / 局限
  • 文章承认在多指精细灵巧性方面仍然存在挑战。
4 分钟 · 4 卡片 · 10 资料
读原文 →

技术原理

平行视角

未来推演

延伸追问