2
#Inverse Reinforcement Learning
Introducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.
En las implementaciones de aprendizaje por refuerzo, el diseño de la función de recompensa suele determinar el resultado más que el propio algoritmo. Este artículo aborda la relación entre recompensas dispersas y densas, la invariancia de la política en la configuración de recompensas basada en el potencial, casos reales de manipulación de recompensas, aprendizaje por refuerzo inverso y aprendizaje por refuerzo con restricciones.
Fundamentals · 10 min de lecturaIntroducción al aprendizaje por refuerzo: aprendizaje por imitación y aprendizaje por refuerzo inverso.
La clonación de comportamiento, DAgger y el aprendizaje por refuerzo inverso utilizan demostraciones cuando resulta difícil programar las recompensas. Esta introducción abarca el cambio de covariables, la inferencia de recompensas, las conexiones VLA, la evaluación, la seguridad y la procedencia de los datos.
Fundamentals · 7 min de lectura