強化学習の実装の中で、アルゴリズムよりも報酬関数の設計が結果を左右することが多い。疎な報酬と密な報酬、ポテンシャルベース報酬シェイピングの方策不変性、報酬ハッキングの実例、逆強化学習と制約付きRLまでを整理する。