Tesla'nın Optimus gibi humanoid robotlar ve Nvidia, Google DeepMind gibi şirketlerin vizyon-dil-eylem (VLA) modelleri, basit ev işlerini yerine getirebiliyor ancak eğitim verileri dışındaki görevlerde başarısız oluyor.

Yann LeCun ve Jonathan Hurst gibi uzmanlar, dil modellerinde işe yarayan yöntemlerin robotikta 'sonsuz veri' sorunu yarattığını ve fiziksel dünyanın sürekli değişen doğasını modelleyemediğini belirtiyor.

Bu nedenle araştırmacılar, robotların dünyayı simüle edip eylem sonuçlarını öngörebileceği 'dünya modelleri' üzerine yoğunlaşıyor; Physical Intelligence'ın π0.7 modeli bu yönde ilk kompozisyonel genelleme ipuçlarını verdi.