全身机器人控制
控制整个人形机器人,从脚到指尖,将视觉和语言转化为运动动作,用于行走、下蹲、伸手和操作。
Gemini Robotics 2 是 Google DeepMind 面向机器人的物理 AI 模型家族,融合全身控制、灵巧操作、具身推理与端侧运行,适用于需感知、规划、执行并跨不同形态协同的机器人。
Gemini Robotics 2 是 Google DeepMind 面向机器人的物理 AI 模型家族。该站点将其定位为适应性机器人所需的智能层,融合全身控制、灵巧操作、具身推理与端侧运行。
产品页展示了三种相关模型:Gemini Robotics 2,一种用于运动控制的视觉-语言-动作模型;Gemini Robotics ER 2,一种用于高层规划和与人类沟通的视觉-语言模型;以及 Gemini Robotics On-Device 2,一种可在机器人硬件上本地运行的高效 VLA 模型。它们共同面向需要感知、推理、执行并跨多种形态协同的机器人。
控制整个人形机器人,从脚到指尖,将视觉和语言转化为运动动作,用于行走、下蹲、伸手和操作。
为五指手和标准夹爪都增加更高水平的物理灵巧性,包括精细和打包类任务。
让机器人推理耗时数分钟、包含多个步骤的任务,然后在跟踪进度的同时与 VLA 模型协调执行。
使多台机器人能够相互通信并分配工作,以完成单台机器人无法独立完成的共同任务。
可在机器人设备本地运行,并设计为仅用几小时的数据即可快速适配新的机器人形态。
类人机器人接收自然语言指令,走到指定位置,在需要时弯腰或下蹲,并将物体放入目标箱或货架。
机器人使用五指手或平行夹爪执行细致操作,例如打结、封合拉链袋或紧密打包。
机器人规划较长的工作流程,跟踪每一步是否成功,在需要时重试,并持续执行直到任务完成。
多台机器人在同一环境中协同,沟通各自优势,并分工完成共同任务。
本地机器人部署将模型适配到新的机器人形态,而不依赖网络连接或云端延迟。
Gemini Robotics ER 2 是具身推理模型。它理解物理世界,规划多步骤任务,与人类沟通,并将运动执行交给更底层的 VLA 模型。
来源说明,Gemini Robotics 2 作为用于控制机器人的视觉-语言-动作模型提供,Gemini Robotics ER 2 可在 Google AI Studio 和 Gemini Enterprise Agent Platform 的私有预览中使用,而 VLA 和端侧模型面向早期访问合作伙伴提供。
页面描述的工作流是由 ER 2 负责推理、规划、进度跟踪与协调,而 VLA 模型在机器人上执行运动控制。
端侧模型经过优化,可在机器人设备本地运行,并设计为只需少量数据即可快速适配新的机器人形态。
来源指出,已经展示了全身控制以及基于夹爪的灵巧任务的中高成功率,但多指灵巧操作仍然具有挑战性。