研究者らは、ロボットの学習プロセスを子ども発達に似せた三段階で設計した。第一段階では、ロボットが人間専門家のリアルタイムの動作を観察し、基本的な動きを習得した。この段階で、RGBカメラと3D点群を用いて視覚入力と行動の関係を構築した。

第二段階では、ロボットが自らの経験を収集し、失敗と成功をもとに方針を改善した。この過程で、オフライン強化学習手法により、人間のデータに依存せずに性能を向上させ、既存のスキルを損なうことなく進歩を遂げた。

第三段階では、まれなエラーを修正するために、少量の現実世界データを用いたオンライン学習を適用した。その結果、成功率は90%から100%に向上した。また、従来のディフュージョンモデルが抱える遅延問題は、単一ステップのコントローラーに変換することで、100ミリ秒から10ミリ秒に短縮された。