Aprendizaje por refuerzo
September 3, 2026
Fundamentos del aprendizaje por refuerzo: Procesos de decisión de Markov, ecuaciones de Bellman y exploración para robots
El aprendizaje por refuerzo es un ciclo cerrado en el que un agente elige acciones a partir de observaciones y maximiza las recompensas diferidas. Esta introducción explica los procesos de decisión de Markov (MDP), las funciones de valor, las políticas, las ecuaciones de Bellman, la exploración frente a la explotación, el diseño de recompensas y el camino desde la simulación hasta un robot real.
Fundamentals · 8 min de lectura