Contents — find the section you need

Q-learning y DQN eligen entre un conjunto finito de acciones. Sin embargo, la velocidad de las ruedas, el empuje del dron o el par del manipulador son continuos. Los métodos de gradiente de política actualizan una política \pi_\theta que genera una distribución sobre acciones continuas. Actor-Critic añade un crítico que evalúa dichas acciones; PPO y SAC añaden estabilización práctica, ampliamente utilizada en la investigación robótica.

Resumen de 30 segundos

  • Los gradientes de política aumentan directamente el retorno esperado J(\theta). Manejan las acciones continuas de forma natural, pero las estimaciones de trayectoria única presentan una alta varianza.

  • Actor-Critic utiliza una estimación de valor como referencia. Advantage mide si una acción fue mejor que la acción promedio en el mismo estado.

  • PPO limita la razón de probabilidad entre las políticas antigua y nueva para que una actualización no se desvíe demasiado. Es sencillo, pero los datos de política actual son difíciles de reutilizar.

  • SAC maximiza tanto la recompensa como la entropía de la política. Se desvía de la política establecida, utiliza repetición y resulta práctico para el control continuo.

  • Ninguno de los métodos proporciona límites de seguridad. Mantenga los límites de acción, los límites de velocidad, el PID/MPC de bajo nivel y las paradas de emergencia fuera del ámbito del programa de aprendizaje.

1. Optimización directa de una política

Diagram 1 · Use the button to switch views
Actor–Crítico: actualización de la política a partir de la experiencia

Figura 1: El Actor propone una distribución continua y el Crítico evalúa el retorno. En el hardware, la acción pasa por un controlador de nivel inferior verificado en lugar de aplicarse directamente al par.

Para una política estocástica \pi_\theta(a\mid s), el gradiente del retorno esperado J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] se puede expresar utilizando el gradiente de la probabilidad logarítmica:

\nabla_\theta J(\theta)=\mathbb{E}_{\pi_\theta}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,G_t\right]

Las acciones que produjeron un alto retorno se vuelven más probables. Dado que G_t es ruidosa y retardada, restar una línea base dependiente del estado b(s_t) reduce la varianza sin modificar Gradiente esperado:

\nabla_\theta J(\theta)=\mathbb{E}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,(G_t-b(s_t))\right]

2. Ventaja y Actor-Crítico

El Crítico aprende V_\phi(s) y estima si una acción fue mejor que el promedio del estado con A_t=Q(s_t,a_t)-V(s_t). Una aproximación TD de un paso es:

\hat A_t=r_{t+1}+\gamma V_\phi(s_{t+1})-V_\phi(s_t)

La Estimación de Ventaja Generalizada (GAE) combina varios pasos con un hiperparámetro de sesgo-varianza \lambda. A medida que \lambda se acerca a uno, utiliza un horizonte más largo y un sesgo menor, pero una varianza mayor. Para un bucle de actitud rápido, utilice el retardo y la escala de tiempo reales de la tarea en lugar de copiar una configuración de referencia.

La pérdida del Actor es:

L_\pi=-\mathbb{E}[\log\pi_\theta(a_t\mid s_t)\hat A_t]

y el Crítico minimiza el error cuadrático medio:

L_V=\mathbb{E}[(V_\phi(s_t)-\hat V_t)^2]

Cuando se comparte un codificador de imágenes, un gradiente modifica ambas estimaciones. Tasas de aprendizaje y gradiente independientes. El recorte y un registro fijo de normalización de observaciones facilitan el diagnóstico de fallos.

3. PPO: no modificar la política drásticamente de una sola vez

Los gradientes de política en política recopilan un despliegue con la política actual. Reutilizarlo para demasiadas actualizaciones aleja la nueva política de la distribución de datos. PPO forma una razón de probabilidad entre la política antigua \pi_{\theta_{old}} y la nueva política,

r_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{old}}(a_t\mid s_t)}

y maximiza la función objetivo recortada.

L^{CLIP}=\mathbb{E}\left[\min\left(r_t\hat A_t,\operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t\right)\right]

Las ventajas positivas no pueden aumentar su probabilidad indefinidamente, y las negativas no pueden disminuirla indefinidamente. Un valor pequeño de \epsilon es conservador; uno grande permite actualizaciones más audaces. El recorte no es una restricción de seguridad, por lo que los límites de articulación, velocidad y fuerza siguen siendo independientes.

Una implementación recopila un despliegue fijo, normaliza Advantage y entrena varias épocas de mini-lotes. Guarda las probabilidades de registro antiguas, distingue un tiempo de espera agotado de un estado terminal real y congela los datos. Estadísticas de normalización en la evaluación. De lo contrario, dos ejecuciones con los mismos pesos pueden comportarse de manera diferente.

4. SAC: recompensa más entropía

El Actor-Crítico Suave (SAC) añade la entropía de la política \mathcal{H}(\pi) a la recompensa futura como objetivo:

J(\pi)=\mathbb{E}\left[\sum_t\gamma^t\left(r_t+\alpha\mathcal{H}(\pi(\cdot\mid s_t))\right)\right]

El término de entropía evita que acciones igualmente buenas se reduzcan a una demasiado pronto, actuando como una temperatura \alpha que mantiene viva la exploración. SAC no sigue una política y utiliza un búfer de repetición, por lo que cada transición del mundo real puede reutilizarse. Esto mejora la eficiencia de la muestra, pero los datos obsoletos, la escala de recompensa y el ajuste de la temperatura son importantes.

Para una acción continua, el Actor genera la media \mu_\theta(s) y la desviación estándar \sigma_\theta(s) de una gaussiana, y luego la transforma en límites con tanh u otra transformación. La probabilidad logarítmica requiere la corrección jacobiana de dicha transformación. Las redes Q gemelas y la estimación Q más pequeña reducen Sobreestimación. Decida si el despliegue utiliza la media determinista o conserva el ruido de exploración.

5. Elección de PPO o SAC

Aspecto PPO SAC
Datos Despliegues con política Reproducción sin política
Exploración Distribución de políticas y bonificación de entropía La entropía forma parte del objetivo
Eficiencia de muestreo Baja a media A menudo alta
Principales errores Probabilidad logarítmica, indicadores de terminal, recorte Sobreestimación de Q, escala de recompensa, corrección de tanh
Ajuste típico Muchos simuladores paralelos Par continuo y escasos datos de hardware

PPO suele ser estable cuando se pueden ejecutar muchos entornos simulados en paralelo. SAC puede ser atractivo cuando cada transición real es costosa. Ninguno de los métodos modela automáticamente el retardo del sensor, las zonas muertas del motor ni la saturación del actuador.

6. La transición de la simulación a la realidad es un límite, no un interruptor

La brecha entre la simulación y la realidad proviene de la masa y la fricción. Reacción inversa, ruido de exposición y del sensor, retardo de red, caída de la batería, material del suelo e iluminación. La aleatorización de dominio muestrea estos parámetros para que la política no se sobreajuste a un valor ideal. El rango debe medirse desde el hardware; aleatorizar mundos imposibles solo dificulta el entrenamiento.

Una transferencia por etapas es más segura: (1) simulación pura, (2) reproducción de registros reales del sensor sin movimiento, (3) pruebas de baja potencia con las ruedas levantadas, (4) velocidad y fuerza limitadas en un suelo despejado y (5) la tarea en sí. Registre la acción solicitada por separado de la acción que el limitador de seguridad realmente permitió. La transición de simulación a realidad es un bucle iterativo de identificación y evaluación, no un solo botón de implementación.

7. Seguridad y evaluación

El recorte de PPO y la entropía de SAC no evitan las colisiones. Los monitores independientes deben verificar la velocidad, la aceleración, el ángulo de la articulación, la fuerza de contacto, la presión hidráulica, la corriente y la temperatura. Ante una observación no válida, NaN, marca de tiempo caducada o pérdida de comunicación, el monitor debe ordenar una parada segura. Colóquelo en un proceso o MCU independiente cuando el riesgo sea elevado. Lo justifica.

Además de la recompensa, mida el éxito, la tasa de colisión, la desviación máxima, la distancia de frenado, la energía, la suavidad de la acción, la latencia de inferencia y la tasa de intervención del limitador de seguridad. Una alta tasa de éxito con intervenciones frecuentes significa que la política depende del limitador. Repita las ejecuciones con varias semillas aleatorias e informe la varianza y los peores casos, no solo la media.

Lista de verificación de implementación

  1. Pruebe las unidades de acción, los límites, el orden de tanh/recorte y las correcciones de probabilidad logarítmica.

  2. Para PPO, guarde las probabilidades logarítmicas antiguas, la ventaja y los indicadores de terminal frente a tiempo de espera.

  3. Para SAC, supervise la distribución de repetición, los valores Q gemelos, la temperatura \alpha y la escala de recompensa.

  4. Asigne el preprocesamiento, la normalización, las semillas, los pesos y los parámetros del entorno al ID del experimento.

  5. Mantenga el PID/MPC de bajo nivel, los límites de velocidad, el temporizador de vigilancia y la parada de emergencia independientes del algoritmo de aprendizaje.

  6. Defina las condiciones de parada para registros pasivos, baja potencia y funcionamiento normal antes de cada transición.

  7. Registre Éxito, colisión, intervención del limitador, latencia, energía y desviación máxima en conjunto.

Resumen

Los gradientes de política optimizan directamente una distribución continua de acciones. Actor-Crítico utiliza Ventaja para reducir la varianza; PPO recorta la actualización; SAC utiliza entropía y repetición para mejorar la exploración y la eficiencia de los datos. Ninguno de ellos resuelve por sí solo la incertidumbre del hardware ni la seguridad. Un controlador de nivel inferior verificado, un monitor independiente, la transferencia por etapas y la evaluación del peor caso forman parte del algoritmo cuando una política aprendida abandona la simulación.

Comprueba tu comprensión
¿Garantiza el recorte de PPO un comportamiento seguro?

Modera el objetivo de optimización, no las restricciones de seguridad física. Evalúa la estabilidad del entrenamiento y la seguridad de la acción por separado.

Referencias

What to read next

Review the backgroundAprendizaje Q y DQN: De la tabla Q al aprendizaje profundo por refuerzo.Continue the seriesIntroducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.Explore another aspect of this fieldIntroducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.