Googleは、ロボットが日常生活で人々を助けるためには、正確な空間的推論能力だけでなく、現実世界のスピードに対応した迅速な意思決定と推論能力が必要だと指摘した。この需要に応えるため、新世代の「身体を持つ知性」モデル「Gemini Robotics ER 2」を発表した。このモデルは、ロボットが人間と会話し、物理的な世界を理解し、多段階のタスクを計画することを可能にする。また、運動実行処理を低レベルの視覚-言語-行動(VLA)モデルに委譲し、Google検索のようなツールを直接呼び出す機能も備えている。

Gemini Robotics ER 2は、Gemini Robotics ER 1.6から大きなアップグレードを提供する。継続的なビデオストリームを監視することで、ロボットが自分の進捗を追跡し、何かが間違っている場合に適応し、次のステップに進むための適切なタイミングを把握できるようにする。さらに、Gemini Robotics ER 2は、ロボットが共通の空間で協力し、単一のロボットでは完了できない複雑なワークフローを実行できるようにする複数ロボット協調機能も提供する。