Reinforcement Learning Primer
Reinforcement Learning Basics — MDPs, Bellman Equations, and Exploration for Robots
Reinforcement learning is a closed loop in which an agent chooses actions from observations and maximizes delayed rewards. This primer explains MDPs, value functions, policies, Bellman equations, exploration versus exploitation, reward design, and the path from simulation to a real robot.