글
기술을 만들고 시험하고 분석합니다. 구현·실험·조사를 통해 작동 원리를 기록합니다.
← 학습 가이드

강화학습 — 학습 가이드

강화학습 — 기초 원리부터 실제 응용까지 체계적인 학습 경로를 따라갑니다.

기초 원리부터 실제 응용까지 체계적인 학습 경로를 따라갑니다.

  1. Fundamentals · 10 분 읽기

    강화 학습 기초 — MDP, 벨만 방정식 및 로봇 탐색

    강화 학습은 에이전트가 관찰을 통해 행동을 선택하고 지연된 보상을 최대화하는 폐쇄 루프입니다. 이 입문서에서는 MDP, 가치 함수, 정책, 벨만 방정식, 탐색과 활용의 차이, 보상 설계, 그리고 시뮬레이션에서 실제 로봇 구현까지의 과정을 설명합니다.

  2. Fundamentals · 10 분 읽기

    Q-러닝과 DQN — Q-테이블에서 심층 강화 학습까지

    Q-러닝은 벨만 최적성 목표를 사용하여 행동 값을 업데이트합니다. 이 입문서는 표 형식의 Q-테이블에서 심층 Q-네트워크에 이르는 과정을 따라가며 경험 재생, 목표 네트워크, 과대평가 및 로봇 스택에서의 안전한 배치에 대해 설명합니다.

  3. Fundamentals · 10 분 읽기

    정책 경사법, PPO 및 SAC — 로봇을 위한 안정적인 연속 제어

    정책 경사(Policy gradients)는 조향, 추력 및 관절 토크가 연속적으로 유지되도록 정책을 직접 업데이트합니다. 이 글에서는 액터-크리틱(Actor-Critic), PPO 및 SAC를 연결하고, 클리핑, 엔트로피 정규화, 평가 및 시뮬레이션에서 실제 환경으로의 전송을 위한 안전 경계에 대해 다룹니다.

  4. Fundamentals · 13 분 읽기

    보상 설계 입문 — 강화 학습에서 "무엇을 극대화할 것인가"가 가장 어려운 이유

    강화 학습 구현에서 보상 함수 설계는 알고리즘 자체보다 결과에 더 큰 영향을 미치는 경우가 많습니다. 이 글에서는 희소 보상과 밀집 보상, 포텐셜 기반 보상 설계의 정책 불변성, 보상 해킹의 실제 사례, 역 강화 학습, 그리고 제약 조건이 있는 강화 학습을 다룹니다.

  5. Fundamentals · 7 분 읽기

    모델 기반 강화 학습 및 시뮬레이션에서 현실로의 전환

    실제 기계를 위한 세계 모델, 예측 오류, MPC, 도메인 무작위화, 시스템 식별 및 안전 모니터링.

  6. Fundamentals · 9 분 읽기

    강화 학습 입문: 모방 학습과 역강화 학습

    행동 복제, DAgger 및 역강화 학습은 보상을 설정하기 어려울 때 시연을 활용합니다. 이 입문 과정에서는 공변량 변화, 보상 추론, VLA 연결, 평가, 안전성 및 데이터 출처에 대해 다룹니다.

  7. Fundamentals · 16 분 읽기

    π0 설명 — 흐름 일치가 VLA 액션 생성 방식을 어떻게 변화시켰는지

    Physical Intelligence의 π0에 대한 소스 기반 기술 가이드: PaliGemma VLM 및 전용 액션 전문가, 조건부 흐름 매칭을 통한 연속 액션 생성, 7가지 로봇 유형에 걸친 교차 구현 훈련, 그리고 RT-2 및 OpenVLA와 같은 자기회귀 VLA 모델과의 차이점.

  8. Fundamentals · 13 분 읽기

    다중 에이전트 강화 학습 입문 - 상대방도 학습하는 세상에서 최적화하기

    여러 에이전트가 동시에 학습할 때, 단일 에이전트 MDP는 더 이상 성립하지 않습니다. 이 논문에서는 비정상성, 협력/경쟁/혼합 환경, CTDE, 크레딧 할당 문제, MADDPG 및 QMIX를 방정식과 도표를 통해 정리합니다.

Search this field →