Gemini Robotics 2

认领

Gemini Robotics 2 是 Google DeepMind 面向机器人的物理 AI 模型家族,融合全身控制、灵巧操作、具身推理与端侧运行,适用于需感知、规划、执行并跨不同形态协同的机器人。

Gemini Robotics 2 preview

概述

Gemini Robotics 2 是 Google DeepMind 面向机器人的物理 AI 模型家族。该站点将其定位为适应性机器人所需的智能层,融合全身控制、灵巧操作、具身推理与端侧运行。

产品页展示了三种相关模型:Gemini Robotics 2,一种用于运动控制的视觉-语言-动作模型;Gemini Robotics ER 2,一种用于高层规划和与人类沟通的视觉-语言模型;以及 Gemini Robotics On-Device 2,一种可在机器人硬件上本地运行的高效 VLA 模型。它们共同面向需要感知、推理、执行并跨多种形态协同的机器人。

能力

全身机器人控制

控制整个人形机器人,从脚到指尖,将视觉和语言转化为运动动作,用于行走、下蹲、伸手和操作。

灵巧操作

为五指手和标准夹爪都增加更高水平的物理灵巧性,包括精细和打包类任务。

多步骤具身推理

让机器人推理耗时数分钟、包含多个步骤的任务,然后在跟踪进度的同时与 VLA 模型协调执行。

多机器人协作

使多台机器人能够相互通信并分配工作,以完成单台机器人无法独立完成的共同任务。

端侧适配

可在机器人设备本地运行,并设计为仅用几小时的数据即可快速适配新的机器人形态。

使用场景

  • 全身家居或工作空间任务

    类人机器人接收自然语言指令,走到指定位置,在需要时弯腰或下蹲,并将物体放入目标箱或货架。

  • 精细灵巧任务

    机器人使用五指手或平行夹爪执行细致操作,例如打结、封合拉链袋或紧密打包。

  • 多步骤任务执行

    机器人规划较长的工作流程,跟踪每一步是否成功,在需要时重试,并持续执行直到任务完成。

  • 协作机器人团队

    多台机器人在同一环境中协同,沟通各自优势,并分工完成共同任务。

  • 端侧部署

    本地机器人部署将模型适配到新的机器人形态,而不依赖网络连接或云端延迟。

Pros and Cons

Pros

  • 控制整个类人身体,而不只是上半身动作。
  • 支持不同机器人形态中的手和夹爪。
  • 在分工的 ER/VLA 工作流中结合了规划、进度跟踪和动作执行。
  • 可在设备本地运行,适合需要低延迟或不依赖互联网连接的部署。
  • 设计为只需几小时的数据即可适配新的机器人本体。

Cons

  • 来源表示移动速度仍有提升空间。
  • 多指灵巧操作被描述为仍然具有挑战性。
  • 所提到的模型仅限于 Google AI Studio、私有预览和早期访问合作伙伴使用。

FAQ

Gemini Robotics ER 2 有什么用途?

Gemini Robotics ER 2 是具身推理模型。它理解物理世界,规划多步骤任务,与人类沟通,并将运动执行交给更底层的 VLA 模型。

Gemini Robotics 2 如何获取?

来源说明,Gemini Robotics 2 作为用于控制机器人的视觉-语言-动作模型提供,Gemini Robotics ER 2 可在 Google AI Studio 和 Gemini Enterprise Agent Platform 的私有预览中使用,而 VLA 和端侧模型面向早期访问合作伙伴提供。

ER 和 VLA 模型如何协同工作?

页面描述的工作流是由 ER 2 负责推理、规划、进度跟踪与协调,而 VLA 模型在机器人上执行运动控制。

端侧模型增加了什么?

端侧模型经过优化,可在机器人设备本地运行,并设计为只需少量数据即可快速适配新的机器人形态。

提到哪些限制?

来源指出,已经展示了全身控制以及基于夹爪的灵巧任务的中高成功率,但多指灵巧操作仍然具有挑战性。

Quick Facts

类别
世界模型与物理 AI
产品家族
Gemini Robotics 2
模型类型
VLA、具身推理(ER)和端侧 VLA
获取方式
Google AI Studio、Gemini Enterprise Agent Platform 私有预览和早期访问合作伙伴
来源域名
deepmind.google