個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
タグ · 全1件

#報酬ハッキング

2026年9月4日 強化学習入門

報酬設計入門 — 「何を最大化させるか」がRLで一番難しい理由

強化学習の実装の中で、アルゴリズムよりも報酬関数の設計が結果を左右することが多い。疎な報酬と密な報酬、ポテンシャルベース報酬シェイピングの方策不変性、報酬ハッキングの実例、逆強化学習と制約付きRLまでを整理する。