Independent projects — infrastructure, robotics, technology surveys, and corporate research
Tag · 1 entries

#Value Function

September 3, 2026 Reinforcement Learning Primer

Reinforcement Learning Basics — MDPs, Bellman Equations, and Exploration for Robots

Reinforcement learning is a closed loop in which an agent chooses actions from observations and maximizes delayed rewards. This primer explains MDPs, value functions, policies, Bellman equations, exploration versus exploitation, reward design, and the path from simulation to a real robot.