個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
タグ · 全1件

#DQN

2026年9月3日 強化学習入門

Q学習とDQN入門 — 表のQ値から深層強化学習へ

Q学習がベルマン最適方程式を使って行動価値を更新する仕組みを、表形式からニューラルネットワークによるDQNまで追う。経験再生、ターゲットネットワーク、過大評価、安全なロボット適用を図と式で解説する。