비전-언어-액션(Vision-Language-Action, VLA)은 카메라 입력과 자연어 명령을 하나의 모델로 통합하여 로봇 동작을 직접 출력합니다. RT-2부터 OpenVLA, 그리고 Physical Intelligence의 π0 계보에 이르기까지, 인지와 제어를 분리하지 않는 설계 철학의 확산을 살펴봅니다.