Gemini Robotics 2

認領

Gemini Robotics 2 是 Google DeepMind 的機器人實體 AI 模型系列,結合全身控制、靈巧操作、具身推理與裝置端運作,適用於需感知、規劃、行動並跨不同型態協作的機器人。

Gemini Robotics 2 preview

概述

Gemini Robotics 2 是 Google DeepMind 的機器人實體 AI 模型系列。該網站將其定位為可適應型機器人的智慧層,結合全身控制、靈巧操作、具身推理與裝置端運作。

產品頁面展示三個相關模型:Gemini Robotics 2,一個用於運動控制的視覺-語言-動作模型;Gemini Robotics ER 2,一個用於高層規劃與人類溝通的視覺-語言模型;以及 Gemini Robotics On-Device 2,一個可在機器人硬體上本機執行的高效率 VLA 模型。這些模型共同面向需要感知、推理、行動並跨不同型態協作的機器人。

功能

全身機器人控制

可控制從腳到指尖的整個人形機器人,將視覺與語言轉換為行動指令,以執行行走、下蹲、伸手與操作。

靈巧操作

為五指手與標準夾爪都加入更高層級的實體靈巧度,包括精細與封裝式任務。

多步驟具身推理

讓機器人能夠推理需要數分鐘且包含多個步驟的任務,接著與 VLA 模型協調執行,同時追蹤進度。

多機器人協作

使多台機器人能彼此溝通並分派工作,以完成單一機器人無法獨立完成的共同任務。

裝置端適應

可在機器人裝置上本機執行,並設計為只需幾小時的資料即可快速適應新的機器人型態。

使用案例

  • 全身家用或工作空間任務

    人形機器人接收自然語言指令,前往某個位置,視需要彎身或蹲下,並將物品放入目標收納箱或層架。

  • 精細靈巧任務

    機器人使用五指手或平行夾爪進行細部操作,例如打結、封合夾鏈袋或緊密包裝。

  • 多步驟任務執行

    機器人規劃較長的工作流程,追蹤每個步驟是否成功,必要時重試,並持續進行直到任務完成。

  • 協作式機器人團隊

    多台機器人在同一環境中協作,溝通各自的強項,並分工完成共同任務。

  • 裝置端部署

    本機機器人部署會將模型適配到新的機器人型態,而不依賴網路連線或雲端延遲。

Pros and Cons

Pros

  • 可控制整個人形身體,而不僅是上半身動作。
  • 可支援不同機器人型態中的手部與夾爪。
  • 在分工的 ER/VLA 工作流程中結合規劃、進度追蹤與動作執行。
  • 可在裝置端本機執行,適合需要低延遲或無網際網路連線的部署。
  • 設計為可在幾小時的資料內適應新的機器人身體。

Cons

  • 來源表示,移動速度仍有改善空間。
  • 多指靈巧操作被描述為仍然具有挑戰性。
  • 上述模型的存取僅限於 Google AI Studio、私人預覽與搶先體驗合作夥伴。

FAQ

Gemini Robotics ER 2 有什麼用途?

Gemini Robotics ER 2 是具身推理模型。它能理解實體世界、規劃多步驟任務、與人類溝通,並將動作執行交由較低層級的 VLA 模型處理。

如何存取 Gemini Robotics 2?

來源指出,Gemini Robotics 2 以視覺-語言-動作模型形式提供,用於控制機器人;Gemini Robotics ER 2 可在 Google AI Studio 以及 Gemini Enterprise Agent Platform 的私人預覽中使用,而 VLA 與 On-Device 模型則提供給搶先體驗合作夥伴。

ER 與 VLA 模型如何協同運作?

頁面描述了一種工作流程:ER 2 負責推理、規劃、進度追蹤與協調,而 VLA 模型負責機器人的動作控制。

裝置端模型增加了什麼?

裝置端模型經過最佳化,可在機器人裝置上本機執行,並設計為只需幾小時的資料即可快速適應新的機器人型態。

提到了哪些限制?

來源指出,已展示全身控制與基於夾爪的靈巧任務具有中到高的成功率,但多指靈巧操作仍然具有挑戰性。

Quick Facts

類別
世界模型與實體 AI
產品系列
Gemini Robotics 2
模型類型
VLA、具身推理(ER)與裝置端 VLA
存取方式
Google AI Studio、Gemini Enterprise Agent Platform 私人預覽,以及搶先體驗合作夥伴
來源網域
deepmind.google