個人開発 — インフラ構築・ロボット開発・技術動向調査・企業研究
Duskcoil
.
ホーム
プロジェクト
記事
About
EN
タグ · 全1件
#DQN
2026年9月3日
強化学習入門
Q学習とDQN入門 — 表のQ値から深層強化学習へ
Q学習がベルマン最適方程式を使って行動価値を更新する仕組みを、表形式からニューラルネットワークによるDQNまで追う。経験再生、ターゲットネットワーク、過大評価、安全なロボット適用を図と式で解説する。