视觉-语言-动作(VLA)将摄像头输入和自然语言指令整合到一个单一模型中,直接输出机器人动作。从RT-2到OpenVLA,再到物理智能的π0系列,本文将探讨这种拒绝将感知与控制分离的设计理念的传播历程。