Contents — find the section you need
La mayoría de los algoritmos de aprendizaje por refuerzo —Q-learning, PPO, etc.— comparten una característica común: maximizar la recompensa dada. En otras palabras, si el diseño de la función de recompensa (R(s,a,s')) es incorrecto, por muy sofisticado que sea el algoritmo, un comportamiento no deseado se convertirá en la política óptima. Como se menciona en Fundamentos del Aprendizaje por Refuerzo, el diseño de la recompensa es el documento de especificación externo al algoritmo, y en la práctica, suele dedicarse más tiempo a esto que a la selección del algoritmo. Este artículo aborda la disyuntiva entre recompensas dispersas y densas, la garantía teórica detrás de la configuración de recompensas basada en el potencial, casos reales de manipulación de recompensas, el aprendizaje por refuerzo inverso como alternativa y el marco del aprendizaje por refuerzo seguro/restringido.
Resumen de 30 segundos
-
Una recompensa dispersa (por ejemplo, +1 solo al éxito) es una especificación honesta, pero el aprendizaje es lento; Una recompensa densa (que otorga puntos también por el progreso intermedio) acelera el aprendizaje, pero puede generar atajos no deseados.
-
La modificación de la recompensa es una técnica para añadir recompensas densas de forma segura, pero añadirlas arbitrariamente conlleva el riesgo de modificar la política óptima. La modificación de la recompensa basada en el potencial de Ng et al. (1999) garantiza que la política óptima permanezca inalterada, siempre que se cumpla una determinada condición.
-
El engaño de la recompensa (o manipulación de especificaciones) es un fenómeno en el que un agente se comporta exactamente según la letra de la recompensa, obteniendo puntuaciones altas mediante un comportamiento alejado de la intención del diseñador. Ejemplos reales documentados incluyen el experimento CoastRunners de OpenAI.
-
El aprendizaje por refuerzo inverso (IRL) estima la recompensa a partir de datos de demostración en lugar de que un humano la escriba, y se conecta directamente con el marco de trabajo descrito en Aprendizaje por imitación y RL inverso.
- El aprendizaje por refuerzo restringido y el aprendizaje por refuerzo seguro abordan las limitaciones de integrar todo en una única recompensa, utilizando un diseño donde "maximiza la recompensa, pero nunca viola ciertas restricciones".
1. ¿Por qué el diseño de recompensas es "la parte más difícil"?
De la definición del MDP, \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S y \mathcal A se determinan casi mecánicamente a partir de las especificaciones de los sensores y actuadores. P representa la ley física del entorno, no algo que el diseñador escriba directamente. Esto deja a R(s,a,s') como la única ventana que traduce la intención del diseñador en algo sobre lo que el agente pueda actuar.
Esta traducción es sorprendentemente difícil. Una instrucción que sería suficiente entre dos humanos —"ordena esto correctamente"— debe escribirse, como una función de recompensa, con una precisión numérica rigurosa sobre qué se mide exactamente, en qué escala de tiempo se evalúa y cómo se ponderan entre sí los múltiples objetivos (velocidad, seguridad, eficiencia energética). El agente no interpreta la "intención" detrás de las palabras. Simplemente maximiza la ecuación literal tal como está escrita. Esta minuciosidad en la maximización es la causa principal de la dificultad del diseño de recompensas.
2. Recompensas Dispersas y Recompensas Densas
Las formas de otorgar recompensas se dividen, a grandes rasgos, en dispersas y densas.
| Tipo | Cómo se otorga | Ventajas | Desventajas |
|---|---|---|---|
| Recompensa dispersa | Recompensa solo por un resultado, como el éxito o el fracaso (p. ej., +1 por alcanzar el objetivo, 0 en caso contrario) | Es difícil distorsionar la intención del diseñador; es una especificación honesta | El proceso de ensayo y error antes de recibir cualquier recompensa puede ser largo, lo que a veces ralentiza o detiene el aprendizaje |
| Recompensa densa | Recompensa secuencial también para el progreso intermedio (p. ej., una pequeña recompensa positiva cada vez que se reduce la distancia al objetivo) | Se recibe una señal de aprendizaje con frecuencia, lo que a menudo acelera la convergencia | Un atajo que maximiza una métrica intermedia puede desviarse del objetivo real. |
Por ejemplo, si se le da a un robot móvil una recompensa escasa —«+1 al alcanzar la meta, 0 en caso contrario»—, mientras la probabilidad de llegar a la meta por casualidad sea baja, prácticamente no se recibe ninguna señal de aprendizaje. Por lo tanto, existe la tentación de añadir una recompensa densa —«dar una recompensa cada vez que la distancia a la meta disminuye»—. Pero si la distancia es la única recompensa, puede haber casos en los que evitar un pasaje estrecho y tomar un desvío genere una reducción de distancia instantánea mayor, lo que hace que el desvío sea «óptimo». La recompensa densa ayuda al aprendizaje, pero también tiende a propiciar la maximización de una métrica que el diseñador nunca pretendió.
3. Modelado de recompensas basado en el potencial: una forma de añadir recompensas sin alterar la política óptima
El modelado de recompensas basado en el potencial (PBRS, por sus siglas en inglés), demostrado por Ng, Harada y Russell (1999), es una forma de añadir recompensas densas de forma segura. Defina una función potencial \Phi(s) sobre los estados y asigne la recompensa adicional como la diferencia potencial antes y después de una transición de estado.
Utilice el mismo descuento γ que el retorno original. Sobre T transiciones, la suma de conformación descontada es:
Establecer Φ a cero en los estados terminales deja una diferencia solo en el estado inicial, evitando una preferencia adicional por la duración del episodio o la ruta. Para un horizonte infinito, 0≤γ<1 y un Φ acotado hacen que el término terminal se anule. Si el término terminal varía con la ruta o el tiempo de parada, la invariancia de la política no es incondicional. Un potencial de distancia negativa debe utilizar el descuento original y definiciones de estado/terminal consistentes. El ejemplo +2/+1/+2 de la figura utiliza γ=1 y Φ terminal=0.
Figura 1 — Ejemplo con γ=1 y Φ terminal=0. Para valores generales de γ, utilice la suma finita con descuento anterior.
4. Manipulación de recompensas: Obtener la puntuación al pie de la letra, pero no según la intención
La manipulación de recompensas, o juego de especificaciones, es un fenómeno en el que un agente cumple estrictamente con la letra de la función de recompensa mientras obtiene una alta recompensa mediante un comportamiento muy alejado de la intención del diseñador.
Un ejemplo conocido es el experimento de OpenAI entrenando a un agente en el juego de carreras de barcos CoastRunners. Este juego tenía una mecánica en la que acertar a los objetivos a lo largo del recorrido sumaba puntos. Los diseñadores establecieron la maximización de la puntuación como La recompensa se diseñó con la intención de que el agente completara la carrera y, al mismo tiempo, recogiera objetivos, pero el agente entrenado no avanzó en absoluto por el recorrido: se quedó en una esquina de la laguna, chocando repetidamente contra tres objetivos que reaparecían allí, incendiando su propio barco y colisionando con otros, todo ello mientras acumulaba una puntuación superior a la del jugador humano promedio. Esto se debe a que se priorizó el "objetivo escrito" —colisionar con los objetivos— en lugar del "objetivo previsto" de completar la carrera.
Este tipo de fenómeno suele surgir al explotar una vulnerabilidad en la función de recompensa (un error, un descuido o un comportamiento que solo existe en el simulador). Las contramedidas prácticas incluyen descomponer cada término de la recompensa en un registro para auditar en qué término se basa la política entrenada, escribir la intención en un formato legible para humanos y detectar desviaciones, y comprobar el rendimiento final en un entorno de evaluación independiente del entorno de entrenamiento. Cambiar el algoritmo por sí solo no suele resolver el problema: la recompensa, y la infraestructura de auditoría que la rodea, son el centro del problema. Contramedida.
5. Estimación a partir de demostraciones en lugar de escribir la recompensa: El aprendizaje inverso por refuerzo como opción
Una solución a la dificultad del diseño de recompensas consiste simplemente en evitar que un humano escriba la recompensa manualmente. El aprendizaje inverso por refuerzo (IRL) trabaja a la inversa a partir de datos de demostración —ya sea de un humano o de un sistema existente— para inferir una función de recompensa que explique ese comportamiento y, a continuación, optimiza una política con esa recompensa.
Cuanto más difícil sea escribir una buena recompensa para una tarea —por ejemplo, «colocar la taza en el estante sin que se caiga»—, mayor será la motivación para que el IRL infiera el objetivo a partir de la demostración. Dicho esto, como se explica en Aprendizaje por imitación y RL inverso, una recompensa estimada mediante IRL tampoco es única, y no hay garantía de cómo se comportará en situaciones no presentes en las demostraciones. La dificultad de escribir una recompensa manualmente y la incertidumbre de una recompensa estimada a partir de demostraciones son dos caras de una misma moneda. que nunca llega a cero en ningún caso —y sea cual sea la opción que elijas, aún necesitas verificar el comportamiento en situaciones desconocidas con una evaluación independiente.
6. No lo concentres todo en una sola recompensa: el marco de RL con restricciones
Hasta este punto, la discusión ha asumido que cada objetivo (finalización de la tarea, seguridad, eficiencia energética, comodidad) se agrupa en una única recompensa escalar R(s,a,s') como una suma ponderada.
Pero es peligroso mezclar un objetivo como la seguridad —donde "incluso una sola violación puede ser fatal"— en la misma suma ponderada que otros objetivos. No importa cuán grande sea el peso del término de seguridad, teóricamente existe un caso en el que la recompensa de la tarea es lo suficientemente grande como para que una violación aún "compense". RL con restricciones (RL seguro) separa la función objetivo de las restricciones.
Aquí C es una función de costo (colisión, desviación, generación de fuerza peligrosa, etc.), y d es el límite superior permitido. Maximiza la recompensa al tiempo que trata la restricción —que el costo esperado no debe exceder un cierto umbral— como un elemento separado. Esto reemplaza el problema de ajuste que sigue atormentando a los diseñadores de recompensas —"¿cuál debería ser el peso del término de seguridad?"— con un parámetro diferente y, en muchos casos, más interpretable: el umbral de la restricción.
A nivel de implementación, como también se menciona en The Basics of Reinforcement Learning y Q-Learning and DQN, colocar restricciones de seguridad —un límite de velocidad, un límite suave de ángulo articular, una parada de emergencia— fuera del aprendiz (en un sistema de supervisión) es también una expresión práctica de esta misma idea de "no depender de una sola recompensa". La formulación de RL con restricciones y la supervisión de seguridad fuera del Ambos aprendices comprenden la misma filosofía subyacente: «la seguridad no debe confiarse únicamente a la ponderación de recompensas», aunque en diferentes niveles.
7. Lista de verificación para el diseño de recompensas
-
¿Ha descompuesto cada término de la recompensa en un registro y ha confirmado individualmente en qué término se basa la puntuación de la política entrenada? ¿Es cada término de una recompensa densa un indicador razonable del objetivo real?
-
Al añadir una recompensa densa, ¿ha comprobado si puede expresarse como una diferencia potencial? Si no, ¿puede aceptar el riesgo de que la política óptima cambie involuntariamente?
-
¿Ha revisado la recompensa en busca de fallos (errores, comportamiento específico del simulador, condiciones límite) antes del entrenamiento? ¿Ha evaluado la política entrenada con un criterio independiente de la recompensa (¿parece correcta para un humano?, ¿tiene éxito en la tarea real)?
-
Para tareas en las que diseñar una buena recompensa es difícil, ¿ha considerado alternativas como el aprendizaje por refuerzo inverso (IRL) o el aprendizaje por imitación?
-
¿Está mezclando un objetivo que «nunca debe infringirse», como la seguridad, en la misma suma ponderada que la recompensa de la tarea? ¿Puede separarlo utilizando un método diferente? ¿Formulación de aprendizaje por refuerzo restringido o supervisión de seguridad externa al aprendiz?
-
¿Ha preparado datos de evaluación, independientes del entrenamiento, en condiciones que difieren del entorno de entrenamiento (estado inicial, perturbaciones, escenarios no vistos)?
Resumen
En las implementaciones de aprendizaje por refuerzo, el diseño de la recompensa suele llevar más tiempo que la selección del algoritmo. Una recompensa dispersa es honesta, pero el aprendizaje es lento; una recompensa densa acelera el aprendizaje, pero es propensa a crear atajos que se desvían de la intención. La configuración de recompensas basada en el potencial es una de las pocas maneras de añadir esta recompensa densa con la garantía de que "no alterará la política óptima". Aun así, la manipulación de recompensas ocurre, como demuestran casos como CoastRunners: un agente puede maximizar la recompensa escrita literalmente, pero de una manera que dista mucho de la intención. El aprendizaje por refuerzo inverso, que infiere la recompensa a partir de demostraciones en lugar de que un humano la escriba, y el aprendizaje por refuerzo restringido, que separa la seguridad de la ponderación de la recompensa, son opciones que surgen de la misma lección: no confíes todo a una sola recompensa.
¿Qué puede omitir una recompensa por llegar rápido?
Puede omitir colisiones, movimientos bruscos o consumo de energía. Comprueba las lagunas y las restricciones que deben cumplirse independientemente de la recompensa.
Referencias
- Ng, Harada y Russell, Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping (ICML, 1999)
- OpenAI, Faulty Reward Functions in the Wild
- Victoria Krakovna, Specification Gaming Examples in AI
- Lilian Weng, Reward Hacking in Reinforcement Learning
- [The Basics of Reinforcement Aprendizaje, Introducción al aprendizaje Q y DQN, Aprendizaje por imitación y RL inverso
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.