個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
タグ · 全2件

#逆強化学習

2026年9月4日 強化学習入門

報酬設計入門 — 「何を最大化させるか」がRLで一番難しい理由

強化学習の実装の中で、アルゴリズムよりも報酬関数の設計が結果を左右することが多い。疎な報酬と密な報酬、ポテンシャルベース報酬シェイピングの方策不変性、報酬ハッキングの実例、逆強化学習と制約付きRLまでを整理する。

2026年9月3日 強化学習入門

強化学習入門:模倣学習と逆強化学習 — 手本から方策と目的を学ぶ

Behavior Cloning、DAgger、逆強化学習は、報酬を手書きしにくいロボット課題で人や既存システムの実演を使う。共変量シフト、報酬推定、VLAとの接続、評価と安全を式と図で解説する。