Contents — find the section you need

El aprendizaje por refuerzo (RL) es un método para que un robot aprenda qué acción resulta más rentable a largo plazo mediante la interacción con su entorno. A diferencia de la clasificación de imágenes, donde una entrada y una etiqueta llegan simultáneamente, el robot observa el mundo, mueve un motor y recibe una recompensa, a menudo varios segundos después. El ciclo esencial es intentar, observar el resultado y actualizar la política.

Resumen de 30 segundos

  • La transición más pequeña en RL es, en el instante t, el estado (u observación) s_t, la acción a_t, la recompensa r_{t+1} y el siguiente estado s_{t+1}.

  • Un proceso de decisión de Markov (MDP) modela cómo el estado y la acción actuales producen un siguiente estado y una recompensa. El estado debe resumir el historial lo suficientemente bien como para permitir la predicción.

  • Una política \pi(a\mid s) elige las acciones; La función de valor V^\pi(s) representa el retorno futuro esperado al seguir dicha política.

  • El retorno descuenta las recompensas futuras con \gamma. Un horizonte demasiado largo puede desestabilizar el aprendizaje, mientras que uno demasiado corto genera un robot miope e inseguro.

  • La exploración prueba acciones inciertas; la explotación elige la acción que se considera mejor en ese momento. En el hardware, las restricciones de seguridad prevalecen sobre ambas.

1. Considerar al robot como un agente

Diagram 1 · Use the button to switch views
Observation, action, and reward loop in reinforcement learning An agent selects an action from an observation and the environment returns the next observation and a reward Agentcomputes π(a|s) Environmentphysics, simulator, or people action aₜ observation oₜ₊₁ and reward rₜ₊₁ state sₜ is an internal summary of the observation history

Figura 1: Después de que un agente actúa, el entorno cambia y devuelve la siguiente observación y recompensa. Un robot real añade retardo de comunicación, ruido del sensor y saturación del actuador a este bucle.

Para un robot de tracción diferencial, el agente puede usar datos de la cámara, el LiDAR y el codificador como su estado y generar velocidades de las ruedas izquierda y derecha como acciones. El entorno incluye la dinámica del vehículo, la fricción del suelo, los obstáculos y el estado de la batería. Moverse hacia un objetivo puede generar una recompensa positiva, mientras que una colisión o un cambio brusco de dirección pueden ser penalizados. Una sola señal de "+1 en el objetivo" suele ser demasiado escasa; la distancia, la velocidad, el margen de frenado y la energía deben considerarse conjuntamente.

2. MDP: división del problema en componentes

Un MDP se define mediante un espacio de estados \mathcal{S}, un espacio de acciones \mathcal{A}, una probabilidad de transición P(s'\mid s,a), una función de recompensa R(s,a,s') y un factor de descuento \gamma:

\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma),\qquad 0\le\gamma<1

Cuando el agente elige la acción a_t en el estado s_t, el entorno transita a un siguiente estado s_{t+1} según P y devuelve la recompensa r_{t+1}=R(s_t,a_t,s_{t+1}).

“Markov” significa que, una vez conocido el estado actual, el pasado ya no aporta información necesaria para predecir el futuro. Un robot móvil cuyo estado solo contiene la posición no puede distinguir entre un robot detenido y uno que se desliza por la misma posición. Incluya la velocidad, la tasa angular y la confianza del sensor, o utilice un modelo recurrente que conserve el historial.

Cuando el estado completo s_t no se puede observar directamente, el problema es un MDP parcialmente observable (POMDP). Casi todos los robots reales son POMDP debido a las oclusiones y la falta de datos LiDAR. Un estimador de estado —un EKF, un grafo factorial o un modelo aprendido— convierte las observaciones o_t en un estado interno útil. El artículo sensor-fusion explica este límite, y la Guía básica de ROS 2 muestra cómo convertirlo en un componente de software reproducible.

3. Funciones de valor y retorno

La suma descontada de las recompensas desde el instante t es el retorno G_t:

G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots

El valor del estado s bajo la política \pi es:

V^\pi(s)=\mathbb{E}_\pi[G_t\mid s_t=s]

y el valor estado-acción también especifica la primera acción:

Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid s_t=s,a_t=a]

Seleccionar el valor Q más grande es un diseño basado en valores. Actualizar directamente los parámetros \theta de una política neuronal \pi_\theta(a\mid s) es un diseño basado en políticas. Los ángulos de dirección continuos y los pares articulares suelen favorecer los métodos de gradiente de política o Actor-Crítico, ya que enumerar todas las acciones posibles es imposible.

4. La ecuación de Bellman divide un horizonte largo en un solo paso

En lugar de evaluar todo el futuro de una vez, se divide en la recompensa inmediata más el valor un paso después. La ecuación de expectativa de Bellman es:

V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^\pi(s')\right]

El valor óptimo V^*(s) obedece la ecuación de optimalidad de Bellman:

V^*(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^*(s')\right]

Por eso, un valor objetivo puede generarse a partir de otras estimaciones en lugar de una etiqueta proporcionada por un humano. La autorreferencia también es una fuente de inestabilidad. Las redes objetivo, la repetición de experiencias y la normalización de recompensas separan las estimaciones antiguas de la actualización actual y reducen las correlaciones perjudiciales.

5. Equilibrio entre exploración y explotación

Seleccionar siempre la acción con la estimación más alta actual puede atrapar al agente en una solución local afortunada. La exploración prueba acciones desconocidas, pero el movimiento aleatorio en una máquina real puede causar una colisión. Las opciones comunes son:

Método Intuición Fuerza Consideraciones de hardware
ε-greedy elige aleatoriamente con probabilidad ε simple los cambios abruptos son inseguros para el par continuo
Boltzmann/softmax muestrea proporcionalmente al valor favorece las opciones prometedoras la temperatura necesita ajuste
UCB prueba acciones con alta incertidumbre justificación de exploración explícita necesita estimaciones de incertidumbre
Política ruidosa añade ruido continuo a las acciones o ponderaciones exploración más fluida aún necesita saturación y límites

En hardware, limita la exploración a un rango operativo validado. Coloca límites de velocidad, límites suaves de las articulaciones, límites de fuerza/corriente, un mecanismo de vigilancia y una parada de emergencia fuera del algoritmo de aprendizaje para que cada salida de la política pueda ser interceptada. La aleatorización en un simulador es útil; no es permiso para aplicar comandos aleatorios a una máquina.

6. Comprueba la idea en un entorno de cuadrícula pequeña

Una cuadrícula de 5×5 hace visible la dinámica del aprendizaje. Sea una celda el estado, arriba/abajo/izquierda/derecha las acciones, la recompensa objetivo +1, una pared -0.1 y cada paso -0.01. Inicialice Q a cero y repita la actualización de la diferencia temporal:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

El término entre corchetes es el error de diferencia temporal: la diferencia entre la predicción y el objetivo de un paso. Si \alpha es demasiado grande, las nuevas experiencias predominan; si es demasiado pequeño, la política no puede adaptarse a un entorno cambiante. Registre la tasa de éxito, el promedio de pasos, la tasa de colisión y la fracción de estados no visitados, no solo una única curva de recompensa.

7. Escriba la recompensa como una especificación

El diseño de la recompensa suele ser más importante que un detalle algorítmico. Un robot de reparto podría usar

r=w_d\,\Delta d-w_c\,\mathbf{1}_{\mathrm{collision}}-w_u\,|u|^2-w_j\,\|\Delta u\|^2

para combinar el progreso, las colisiones, la energía de entrada y la suavidad. Aumentar un peso w no siempre mejora el comportamiento. Si la penalización por colisión predomina, el robot puede aprender la política segura pero inútil de no moverse. Registre cada término por separado y verifique qué término está optimizando realmente la política.

El engaño de recompensas es otro modo de fallo: un error en el detector de objetivos, un punto ciego del sensor o una regla de contacto exclusiva del simulador pueden producir una puntuación alta sin lograr la tarea prevista. Los objetivos comprensibles para el usuario, las restricciones basadas en la física y un entorno de evaluación independiente facilitan la detección de estos atajos.

8. Donde la investigación se encuentra con el producto

Los métodos de valor son eficientes en el uso de datos, pero a menudo asumen estados y acciones discretos. Los gradientes de política y los métodos Actor-Crítico manejan el control continuo; SAC añade un objetivo de entropía, mientras que el aprendizaje por refuerzo basado en modelos planifica con un modelo dinámico aprendido o analítico antes de mover el robot. Los métodos basados en modelos pueden reducir las muestras del mundo real, pero deben tolerar errores del modelo.

En producción, el aprendizaje por refuerzo no se aplica necesariamente a todas las capas, desde la monitorización de seguridad hasta la corriente del motor. Un controlador PID o MPC clásico puede proporcionar el margen de seguridad mientras que el aprendizaje por refuerzo (RL) selecciona un punto de contacto, una ruta preferida o una programación de ganancia. La descripción general de VLA describe un límite similar: un modelo de lenguaje de visión puede proponer secuencias de acciones mientras un controlador de bajo nivel verificado limita el par y la velocidad.

9. Antes de pasar al hardware

  • ¿El estado incluye velocidad, retardo y confianza del sensor, o se ha incumplido silenciosamente la suposición de Markov?

  • ¿Se registran por separado los términos de recompensa, con la tasa de colisión, la energía, la suavidad de la entrada y la distancia de frenado, además de la tasa de éxito?

  • ¿Los rangos de acción, los límites de velocidad, los mecanismos de vigilancia y las paradas de emergencia son independientes del modelo de aprendizaje?

  • ¿Se aleatorizaron la fricción, la masa, el retardo del sensor, la iluminación y la pérdida de paquetes en la simulación, y se midió la brecha de distribución en registros reales?

  • ¿Se mantiene un conjunto de evaluación no visto separado de los datos de entrenamiento? ¿Se incluyen los fallos en lugar de filtrarlos?

¿El reinicio de un proceso entra en un estado seguro y evita la repetición de un comando anterior?

Resumen

El aprendizaje por refuerzo no hace que un robot memorice un "movimiento correcto". Define estados, acciones, transiciones y recompensas como un MDP (Proceso de Decisión de Markov) y luego estima el valor a largo plazo paso a paso con ecuaciones de Bellman. La exploración, la optimización de recompensas y la seguridad del hardware deben formar parte del diseño del sistema antes de que una política aprendida pueda salir de la simulación. Los próximos artículos de esta serie compararán Q-learning/DQN, gradientes de política, PPO y SAC, aprendizaje por imitación y Sim-to-Real dentro del mismo marco.

Comprueba tu comprensión
¿La acción con la mayor recompensa inmediata es siempre la mejor?

Las recompensas y transiciones futuras pueden cambiar la respuesta.

Distinga entre recompensa inmediata y retorno descontado. ## Referencias - [Richard S. Sutton y Andrew G. Barto, Aprendizaje por Refuerzo: Una Introducción (2.ª ed.)](http://incompleteideas.net/book/the-book-2nd.html) - [OpenAI Spinning Up: Conceptos Clave en RL](https://spinningup.openai.com/en/latest/spinningup/rl_intro.html) - [David Silver, Curso de Aprendizaje por Refuerzo](https://www.davidsilver.uk/teaching/) - [Documentación Oficial de ROS 2](https://docs.ros.org/en/rolling/) - [Robótica: Ciencia y Sistemas: Artículos de investigación públicos](https://roboticsconference.org/)

What to read next

Continue the seriesAprendizaje Q y DQN: De la tabla Q al aprendizaje profundo por refuerzo.Explore another aspect of this fieldIntroducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.Explore another aspect of this fieldExplicación de π0: cómo la coincidencia de flujo cambió la generación de acciones de VLA