Aprendizaje por refuerzo
September 3, 2026
Aprendizaje Q y DQN: De la tabla Q al aprendizaje profundo por refuerzo.
El aprendizaje Q actualiza los valores de acción con el objetivo de optimalidad de Bellman. Esta introducción recorre el camino desde una tabla Q tabular hasta una red Q profunda, explicando la reproducción de experiencias, las redes objetivo, la sobreestimación y la ubicación segura en una pila de robots.
Fundamentals · 7 min de lectura