Contents — find the section you need

비전-언어-액션(VLA) 모델은 카메라 영상과 자연어 명령을 하나의 시스템으로 통합하여 로봇의 동작(모터 명령)을 직접 출력하는 아키텍처입니다. 로봇 공학에서 인식(인지)과 제어(계획 및 실행)를 별개의 파이프라인으로 설계해 온 기존 방식과는 달리, VLA 모델의 핵심 아이디어는 두 기능을 하나의 트랜스포머 모델로 통합하는 것입니다.

시각, 언어, 행동의 일러스트시각 + 언어 → 행동

주요 VLA 회사(Physical Intelligence 등)의 공식 로고를 라이선스 없이 사용할 수 없어 시각, 언어, 행동의 통합을 나타내는 간단한 아이콘을 제작했습니다.

VLA 개요

Diagram 1 · Use the button to switch views
VLA 시스템은 이미지, 언어 명령, 로봇 상태를 각각 토큰으로 변환하고, 변환기와 액션 헤드를 통해 행동 시퀀스를 생성한 후, 다음 시각적 관찰 결과를 반환합니다.

다이어그램: Duskcoil. VLA 추론과 물리적 세계 피드백 간의 대표적인 관계를 간략하게 보여줍니다.

VLA는 단순히 이미지와 언어를 읽을 수 있는 모델이 아닙니다. VLA는 그 일부입니다. 물리적 동작과 연결된 출력값을 갖는 폐쇄 루프 구조입니다. 이미지, 명령, 관절 상태는 공통 표현으로 매핑되고, 트랜스포머는 컨텍스트를 통합하며, 액션 헤드는 이를 동작 덩어리로 변환합니다. 실행 후 관찰 결과가 다음 입력으로 사용되므로, 실제 평가에는 모델 정확도뿐만 아니라 추론 지연 시간, 동작의 부드러움, 그리고 비정상적인 동작 발생 시 안전하게 중지하는 메커니즘도 포함되어야 합니다.

계보: RT-1에서 RT-2, OpenVLA까지

구글의 RT-1은 초기 대표적인 모델이었으며, 후속 모델인 RT-2는 웹 규모의 시각 및 언어 데이터로 사전 학습된 대규모 모델의 지식을 활용하여 로봇 동작 생성에 적용함으로써 이 아이디어를 더욱 발전시켰습니다. 오픈 소스 측면에서는 Open-VLA, Octo, CLIP-RT와 같은 모델들이 시각과 언어를 아우르는 상호 주의 메커니즘인 크로스모달 어텐션을 기반으로 하는 트랜스포머 기반 아키텍처를 채택했습니다. 이 모든 모델의 공통점은 "보는 것", "이해하는 것", "행동하는 것"이 별도의 모듈로 분리되지 않고, 입력(영상 및 언어)부터 시작하여 단일 네트워크가 엔드 투 엔드로 학습된다는 점입니다. 시각 정보(지시)부터 출력(행동)에 이르기까지 모든 과정을 거칩니다.

내부 구조: 세 가지 하위 시스템

VLA 모델의 연산 아키텍처는 크게 세 가지 하위 시스템으로 이해할 수 있습니다. 첫째, 비전 인코더는 카메라에서 얻은 원시 픽셀 데이터를 구조화된 특징 표현으로 변환합니다. 이 표현은 종종 SigLIP 또는 DINOv2와 같은 사전 학습된 이미지 인코더를 조합하여 사용됩니다. 다음으로 투영 모듈(일반적으로 다층 퍼셉트론)이 추출된 시각적 특징을 언어 모델이 작동하는 임베딩 공간으로 매핑합니다. 마지막으로 디코더 전용 트랜스포머가 시각 및 언어(지시) 토큰의 연결된 시퀀스를 처리하고 최종 행동을 생성합니다.

행동 생성: 두 가지 설계 접근 방식

시각 정보와 언어가 통합되면 실제 운동 명령(행동)을 생성하는 방법에는 크게 두 가지 설계 접근 방식이 있습니다.

첫 번째는 이산 행동 토큰을 사용하는 것입니다. 연속적인 행동 값(관절 각도, 속도 등)을 고정된 개수의 토큰으로 이산화합니다. 예를 들어 256개의 빈과 언어 모델 어휘에서 다른 용도로 거의 사용되지 않는 토큰 ID를 재활용하여 동작을 나타냅니다. 이러한 방식의 장점은 시각, 언어, 동작을 모두 동일한 유형의 "토큰 시퀀스"로 균일하게 처리할 수 있다는 것입니다. 이를 통해 동작 시퀀스 a_{1:T}를 자기회귀적으로 생성하는데, 이는 관찰값 o에 조건부로 적용되어 각 토큰이 이전 토큰을 기반으로 다음 토큰을 생성합니다.

p(a_{1:T} \mid o) = \prod_{t=1}^{T} p(a_t \mid a_{1:t-1}, o)

이 공식은 자연어 생성에서 다음 단어 예측과 정확히 동일한 형태를 가지며, 시각, 언어, 동작을 동일한 확률 모델 내에서 처리하는 VLA의 핵심 아이디어를 포착합니다.

다른 접근 방식은 확산 기반 동작 헤드를 사용합니다. 변환기의 역할은 시각 및 언어 정보를 요약하는 "판독 토큰"을 생성하는 것으로 축소되고, 실제 연속적인 동작 값 생성은 확산 모델에 맡겨집니다. 단계적으로 생성되는 이산적인 동작 토큰은 때때로 한계를 보일 수 있습니다. 실시간 반응성과 부드러움에 중점을 두는 반면, 확산 기반 액션 헤드는 더 부드럽고 연속적인 액션 출력을 생성하는 경향이 있습니다. 이 두 가지를 결합한 방식도 점점 더 보편화되고 있습니다. 예를 들어, Octo는 이미지와 언어 토큰을 단일 시퀀스로 트랜스포머에 통과시킨 다음, 그 출력(판독 토큰)을 조건으로 확산 기반 액션 헤드에 전달합니다.

이 설계가 실제에 미치는 영향

기존의 제어 시스템은 설계되지 않은 상황에서는 스크립트대로만 작동할 수 있습니다. VLA 모델의 장점은 명시적으로 학습되지 않은 상황에도 일반화할 수 있다는 것입니다. 창고 자동화에서 수술 보조 로봇에 이르기까지 적용 범위가 빠르게 확장되고 있으며, 체화된 AI의 핵심 기술로 자리매김하고 있습니다. 동시에 대규모 인간 시연 데이터에 대한 의존도는 데이터 수집 및 학습 비용 측면에서 여전히 큰 과제입니다.

물리 지능의 π0 계보

최근 VLA 분야에서 가장 주목받는 이름 중 하나는 π0(파이제로)입니다. 4억 달러 이상의 투자를 유치한 스타트업 Physical Intelligence에서 개발한 π0는 다양한 작업을 처리할 수 있는 범용 로봇 정책으로, 대규모 다중 작업, 다중 로봇 데이터 수집과 새로운 네트워크 아키텍처를 결합했습니다. 빨래 개기, 테이블 정리, 커피 원두 퍼 담기 등 다양한 작업을 수행할 수 있습니다. Physical Intelligence는 π0의 코드와 가중치를 오픈파이(openpi) 저장소로 오픈소스 공개했으며, 이후 π0.5, π0.6, π0.7 등 개선된 버전을 지속적으로 출시해 왔습니다. π0 기본 모델은 Open X-Embodiment(OXE) 데이터셋과 Physical Intelligence의 자체 로봇 플랫폼 7개를 사용하여 사전 학습되었으며, 미세 조정을 위한 범용 모델로 설계되었습니다. 사전 학습 데이터로 이미 처리되는 작업에는 바로 사용할 수 있지만, 특정 사용 사례에 맞춰 미세 조정을 거치도록 설계되었습니다.

Physical Intelligence 최신 소식: π0.7 및 그 이후

Physical Intelligence 공식 블로그에 따르면, π0 시리즈는 2026년까지 꾸준히 기능을 추가할 예정입니다. 2026년 3월에는 두 가지 획기적인 발표가 잇따랐습니다. 하나는 VLA 모델에서 추출한 "RL 토큰"을 사용하여 온라인 강화 학습을 통해 실제 로봇 조작 작업을 신속하게 개선하는 방법이고, 다른 하나는 장단기 기억을 통합하여 10분 이상 소요되는 작업을 처리하는 "다중 스케일 체화 기억(Multi-Scale Embodied Memory)"입니다. 4월에 발표된 π0.7은 외부에서 조종 가능한 모델로, 일반화 성능에서 "획기적인 변화"를 가져오는 새로운 기능을 보여줍니다. 개발의 중심은 단일 작업 시연 모방에서 진정한 자율 로봇 작동에 훨씬 더 가까운 기능, 즉 기억, 온라인 학습, 조종 가능성으로 이동하는 것으로 보입니다.

LIBERO 포화 및 속도 경쟁

VLA 연구의 표준이 된 시뮬레이션 벤치마크인 LIBERO는 2026년 하반기까지 여러 방법이 90% 후반대의 작업 성공률을 달성했으며, 정확도가 사실상 포화 상태에 가까워지고 있습니다. (Temporal Forcing, 8월) 4D 장면 표현에 맞춰 시간적 맥락 이해를 강화하는 DriftingVLA(2026년 발표)는 LIBERO 벤치마크에서 98.8%의 정확도를 기록하며, 더 어려운 "숨겨진 위치 지정" 작업에서 성공률을 20.0%에서 43.3%로 끌어올렸습니다. 이는 표준 벤치마크가 포화 상태에 이르면서 연구 분야의 평가 초점이 더 어려운 일반화 작업으로 이동하고 있음을 보여줍니다.

다양한 방법론에서 정확도가 수렴함에 따라 연구의 초점 또한 추론 속도 최적화로 옮겨가고 있습니다. 기존의 다단계 확산 과정을 단일 순방향 패스로 대체하는 DriftingVLA(2026년 8월 발표)는 LIBERO에서 98.32%의 성공률을 유지하면서 반복 방식 대비 액션 청크 생성 속도를 3.36배 향상시켰습니다. 이미 학습된 모델을 재학습 없이 가속화하는 AdaVLA(2026년 8월 발표, IROS 2026)는 곡선의 곡률을 통해 생성 신뢰도를 추정하는 지표를 도입했습니다. 흐름 일치 궤적(flow-matching trajectory)은 추가 학습 없이 π0.5와 X-VLA에서 각각 1.87배와 2.24배의 속도 향상을 달성했습니다. 장기적인 작업에서 부드러운 동작 생성을 목표로 하는 SMILE(2026년 8월)은 B-스플라인 계수를 예측하는 설계를 통해 LIBERO에서 98.0%의 성공률을 유지하면서 1.1배의 속도 향상을 보고했습니다. "정확도를 희생하지 않고 더 빠르게"라는 목표는 2026년 하반기 VLA 연구의 주요 축 중 하나가 되었습니다.

2026년의 확산

VLA 분야의 연구는 2026년에도 빠른 속도로 계속될 것으로 예상됩니다. 액션 매니폴드 학습을 통합한 ABot-M0, 체화된 에이전트 AI를 위한 통합 기반 모델인 ACE-Brain-0.5, 세계 모델과 액션을 통합한 Kairos 등 연구는 단순한 "보고 움직이는" 것을 넘어 모델링으로 확장되고 있습니다. 물리적 세계에서 기억하고 행동하는 것을 통합적으로 수행합니다. VLA(가상 로봇 인식) 개념 자체는 로봇 공학에 특화된 기술에서 더 광범위한 "물리적 AI" 프레임워크의 핵심 요소로 재정립되고 있습니다.

평가가 끝나고 실제 로봇 작동이 시작되는 지점

VLA 벤치마크 결과는 통제된 조건 하에서의 비교 측정값입니다. 벤치마크 정의에는 훈련 로봇, 카메라 배치, 명령 문구, 성공 기준 및 재설정 절차가 포함됩니다. 벤치마크 성공률은 다른 로봇이나 작업 환경의 안전성을 보장하는 것으로 직접 해석될 수 없습니다. 실제 배포 전에는 속도, 가속도 및 관절 제한을 적용하고 통신 두절, 추론 시간 초과 또는 센서 오류 발생 시 로봇을 정지시키는 별도의 감독 계층이 필요합니다.

VLA에서 생성된 액션 청크는 추론 시점에 사용 가능한 관찰을 기반으로 한 예측입니다. 청크 실행 중에 사람이나 물체가 움직이면 추가 관찰 없이 전체 청크를 실행하면 시스템에 오래된 인식에 기반한 명령이 남게 됩니다. 더 짧은 청크를 사용하면 이러한 문제를 방지할 수 있습니다. 더 빈번한 재계획은 반응성을 향상시키지만 추론 및 통신 부하를 증가시킵니다. 더 긴 데이터 덩어리는 더 효율적일 수 있지만, 가림이나 접촉 변화에 대한 반응 속도는 느려집니다. 연구에서 실제 운영으로의 실질적인 연결 고리는 작업 성공률 외에도 정지 거리, 재계획 주기, 복구율을 측정하는 것입니다.

훈련 데이터의 분포 또한 중요합니다. 훈련 조건과 다른 조명, 재질, 관절 마찰, 카메라 지연 시간은 실제 로봇에서 동작 오류로 나타날 수 있습니다. 따라서 평가는 반복적인 알려진 작업과 움직이는 물체가 있는 테스트, 변형된 지시, 가림 후 복구, 의도적으로 지연된 통신을 사용한 테스트를 구분해야 합니다. 단순히 모델에게 실패 후 재시도하도록 요청하는 것만으로는 원인을 파악할 수 없습니다. 입력 이미지, 지시, 생성된 동작, 감독 한계, 정지 이유를 하나의 공통 시간 기준에 저장해야 합니다. 이렇게 하면 인지 오류와 기계적 또는 통신 오류를 더 쉽게 구분하고 모델 업데이트 후 동일한 평가를 반복할 수 있습니다.

배포 결정 또한 단계적으로 이루어져야 합니다. 시뮬레이션에서의 성공, 실험실에서 작동하는 정지 조건, 제한된 환경에서의 작업 완료는 서로 다른 증거입니다. 실외 또는 실제 환경으로 이동하기 전에 이러한 요소들을 고려해야 합니다. 인간과 공유하는 공간, 미지의 물체 테스트, 조명 변화, 배터리 부족, 네트워크 손실 등의 상황을 고려한 후, 모델을 신뢰할 수 있는 조건과 기존 제어 시스템으로 제어권을 되돌려야 하는 조건을 명확히 문서화해야 합니다. 이러한 경계를 명시적으로 정의함으로써 제어 시스템에 필요한 검증 가능성을 유지하면서도 VLA의 유연성을 확보할 수 있습니다.

실험 기록에는 모델 및 가중치 버전, 입력 해상도, 추론 시간, 제어 기간, 동작 유지 시간 등이 포함되어야 합니다. 이러한 항목이 없으면 동일한 모델을 다시 실행해도 비교 가능한 결과를 얻을 수 없습니다. "성공"의 의미도 다양할 수 있습니다. 목표 지점에 물체를 배치하는 것, 접촉을 피하는 것, 제한 장치가 개입한 후 작업을 완료하는 것 등이 성공의 예입니다. 성공 및 중단 기준을 사전에 정의하고, 모델이 생성한 결과와 감독 계층에서 허용한 결과를 별도로 보고해야 합니다. 운영상의 의사 결정에 연구 결과를 활용하려면 측정 조건과 측정되지 않은 범위를 동일한 표에 기록해야 합니다.

일상적인 운영 환경에서는 모델 자체는 변경되지 않았더라도 카메라 교체나 조명 변화로 인해 동작이 바뀔 수 있습니다. 분포 변화를 감지하려면 신뢰도 지표, 동작 크기, 그리고 횟수를 지속적으로 기록해야 합니다. 감독 계층의 개입이 필요합니다. 비정상적인 값이 지속될 경우, 자동 재시도를 반복하는 것보다 저속 모드 또는 수동 작동으로 전환하는 것이 진단이 더 쉽습니다. 관찰, 추론, 제한 및 중지를 분리하는 시스템의 구성 요소 중 하나로 VLA를 취급하면 재현성과 안전성을 모두 지원할 수 있습니다.

이해도 점검
명백한 지시 이해도가 안전한 로봇 동작을 보장합니까?

동작 제한, 실행 조건, 오류 감지 및 중지 메커니즘은 여전히 필요합니다. 유창한 언어 구사가 물리적 성공의 증거는 아닙니다.

참고 자료

What to read next

Review the background세계 모델의 기술 동향Continue the series휴머노이드 로봇 기술 동향Explore another aspect of this field내비게이션 기술 동향