カメラ映像と自然言語指示を1つのモデルに統合し、ロボットの動作を直接出力するVision-Language-Action。RT-2からOpenVLA、Physical Intelligenceのπ0系列まで、知覚と制御を分離しない設計思想の広がりを整理する。