個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
タグ · 全1件

#価値関数

2026年9月3日 強化学習入門

強化学習の基礎 — MDP・ベルマン方程式・探索と活用をロボットで理解する

強化学習を「正解ラベルを当てる学習」ではなく、観測から行動を選び、遅れて返る報酬を最大化する閉ループとして捉える。MDP、価値関数、方策、ベルマン方程式、探索と活用、シミュレーション実装までをロボットの例で図解する。