2
#imitation learning
강화학습
September 4, 2026
강화학습
September 3, 2026
π0 설명 — 흐름 일치가 VLA 액션 생성 방식을 어떻게 변화시켰는지
Physical Intelligence의 π0에 대한 소스 기반 기술 가이드: PaliGemma VLM 및 전용 액션 전문가, 조건부 흐름 매칭을 통한 연속 액션 생성, 7가지 로봇 유형에 걸친 교차 구현 훈련, 그리고 RT-2 및 OpenVLA와 같은 자기회귀 VLA 모델과의 차이점.
Fundamentals · 16 분 읽기강화 학습 입문: 모방 학습과 역강화 학습
행동 복제, DAgger 및 역강화 학습은 보상을 설정하기 어려울 때 시연을 활용합니다. 이 입문 과정에서는 공변량 변화, 보상 추론, VLA 연결, 평가, 안전성 및 데이터 출처에 대해 다룹니다.
Fundamentals · 9 분 읽기