#Sim-to-Real
Fundamentos del aprendizaje por refuerzo: Procesos de decisión de Markov, ecuaciones de Bellman y exploración para robots
El aprendizaje por refuerzo es un ciclo cerrado en el que un agente elige acciones a partir de observaciones y maximiza las recompensas diferidas. Esta introducción explica los procesos de decisión de Markov (MDP), las funciones de valor, las políticas, las ecuaciones de Bellman, la exploración frente a la explotación, el diseño de recompensas y el camino desde la simulación hasta un robot real.
Fundamentals · 8 min de lectura Aprendizaje por refuerzo September 3, 2026Aprendizaje por refuerzo basado en modelos y de simulación a la realidad.
Modelos del mundo, error de predicción, MPC, aleatorización de dominios, identificación de sistemas y monitorización de seguridad para máquinas reales.
Fundamentals · 5 min de lecturaGradientes de política, PPO y SAC: control continuo estable para robots
Los gradientes de política actualizan directamente una política para que la dirección, el empuje y el par articular se mantengan continuos. Este artículo relaciona Actor-Crítico, PPO y SAC, y luego aborda el recorte, la regularización de entropía, la evaluación y el límite de seguridad para la transferencia de simulación a la realidad.
Fundamentals · 7 min de lectura