個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
タグ · 全2件

#Sim-to-Real

2026年9月3日 強化学習入門

強化学習の基礎 — MDP・ベルマン方程式・探索と活用をロボットで理解する

強化学習を「正解ラベルを当てる学習」ではなく、観測から行動を選び、遅れて返る報酬を最大化する閉ループとして捉える。MDP、価値関数、方策、ベルマン方程式、探索と活用、シミュレーション実装までをロボットの例で図解する。

2026年9月3日 強化学習入門

方策勾配・PPO・SAC入門 — 連続行動を安定して学ぶ

連続した操舵角や関節トルクを扱うため、方策を直接更新する方策勾配法からActor-Critic、PPO、SACまでをつなげて解説する。クリッピング、エントロピー正則化、評価指標、Sim-to-Realの安全境界を図と式で整理する。