全身機器人控制
可控制從腳到指尖的整個人形機器人,將視覺與語言轉換為行動指令,以執行行走、下蹲、伸手與操作。
Gemini Robotics 2 是 Google DeepMind 的機器人實體 AI 模型系列,結合全身控制、靈巧操作、具身推理與裝置端運作,適用於需感知、規劃、行動並跨不同型態協作的機器人。
Gemini Robotics 2 是 Google DeepMind 的機器人實體 AI 模型系列。該網站將其定位為可適應型機器人的智慧層,結合全身控制、靈巧操作、具身推理與裝置端運作。
產品頁面展示三個相關模型:Gemini Robotics 2,一個用於運動控制的視覺-語言-動作模型;Gemini Robotics ER 2,一個用於高層規劃與人類溝通的視覺-語言模型;以及 Gemini Robotics On-Device 2,一個可在機器人硬體上本機執行的高效率 VLA 模型。這些模型共同面向需要感知、推理、行動並跨不同型態協作的機器人。
可控制從腳到指尖的整個人形機器人,將視覺與語言轉換為行動指令,以執行行走、下蹲、伸手與操作。
為五指手與標準夾爪都加入更高層級的實體靈巧度,包括精細與封裝式任務。
讓機器人能夠推理需要數分鐘且包含多個步驟的任務,接著與 VLA 模型協調執行,同時追蹤進度。
使多台機器人能彼此溝通並分派工作,以完成單一機器人無法獨立完成的共同任務。
可在機器人裝置上本機執行,並設計為只需幾小時的資料即可快速適應新的機器人型態。
人形機器人接收自然語言指令,前往某個位置,視需要彎身或蹲下,並將物品放入目標收納箱或層架。
機器人使用五指手或平行夾爪進行細部操作,例如打結、封合夾鏈袋或緊密包裝。
機器人規劃較長的工作流程,追蹤每個步驟是否成功,必要時重試,並持續進行直到任務完成。
多台機器人在同一環境中協作,溝通各自的強項,並分工完成共同任務。
本機機器人部署會將模型適配到新的機器人型態,而不依賴網路連線或雲端延遲。
Gemini Robotics ER 2 是具身推理模型。它能理解實體世界、規劃多步驟任務、與人類溝通,並將動作執行交由較低層級的 VLA 模型處理。
來源指出,Gemini Robotics 2 以視覺-語言-動作模型形式提供,用於控制機器人;Gemini Robotics ER 2 可在 Google AI Studio 以及 Gemini Enterprise Agent Platform 的私人預覽中使用,而 VLA 與 On-Device 模型則提供給搶先體驗合作夥伴。
頁面描述了一種工作流程:ER 2 負責推理、規劃、進度追蹤與協調,而 VLA 模型負責機器人的動作控制。
裝置端模型經過最佳化,可在機器人裝置上本機執行,並設計為只需幾小時的資料即可快速適應新的機器人型態。
來源指出,已展示全身控制與基於夾爪的靈巧任務具有中到高的成功率,但多指靈巧操作仍然具有挑戰性。