Contents — find the section you need

En resumen

El aprendizaje por refuerzo basado en modelos (MBRL) aprende un modelo del mundo \hat f, que relaciona el estado y la acción con un estado siguiente previsto, prueba secuencias de acciones dentro de él y aplica únicamente una acción supervisada al hardware. Los métodos sin modelo aprenden una política directamente a partir de la recompensa; el MBRL puede ser más eficiente en el uso de datos y puede expresar restricciones, pero un error en el modelo puede generar éxitos solo en el simulador. Consulte Conceptos básicos de RL, Aprendizaje Q, PPO/SAC y MPC.

Modelos y planificación mundiales

Diagram 1 · Use the button to switch views
observationsworld modelMPC/policysafety monitor

Figura 1 — SVG conceptual creado por Duskcoil, no datos del sistema medidos.

Aprender \hat s_{t+1}=\hat f_\theta(s_t,a_t) y optimizar un objetivo de horizonte deslizante:

a_{t:t+H}^*=\arg\max\sum_{k=0}^{H-1}\gamma^k\hat r(\hat s_{t+k},a_{t+k})-\lambda C(\hat s,a)
Solo se ejecuta la primera acción; luego se observa el sistema nuevamente. Las restricciones C pueden representar límites de colisión, articulación, temperatura, velocidad o corriente. Aquí s es el estado y a la acción; el modelo predice el siguiente estado y \pi(a|s) puede proponer acciones. La recompensa aprendida \hat r_\theta(s_t,a_t) se evalúa en el tiempo t sobre el horizonte H. En el ejemplo numérico que se muestra a continuación, se utiliza un carro con masa 1\,\mathrm{kg} y entrada u.

Simulación a la realidad, identificación y seguridad

Los errores de un solo paso se acumulan en implementaciones prolongadas. Los conjuntos de modelos pueden estimar la incertidumbre; los planificadores pueden evitar regiones de alta varianza y utilizar horizontes temporales cortos. La aleatorización del dominio varía la masa, la fricción, el retardo, el ruido del sensor, la iluminación y la posición de la cámara. La identificación del sistema mide la inercia, la fricción, las constantes del motor y la latencia, de modo que estos rangos sean defendibles en lugar de arbitrarios.

Paso del registro de eventos al control de sombra a baja velocidad y a ensayos supervisados limitados. Mantener la parada de emergencia, los monitores independientes de velocidad/fuerza/temperatura, la parada por pérdida de comunicación y la separación humana fuera de la política aprendida. Los fallos comunes incluyen simulaciones de fricción fija que provocan deslizamiento de las ruedas, sobreajuste de la iluminación, manipulación de recompensas que genera vibraciones y retardo no modelado que causa inestabilidad. Informar sobre el número de infracciones, la distancia de frenado y la incertidumbre activada. Abstención y comportamiento en el peor de los casos: no solo recompensa media.

Roles sin modelo y basados en modelo

El aprendizaje por refuerzo sin modelo actualiza una política o valor directamente a partir de la experiencia. Es expresivo cuando la dinámica de contacto es difícil de modelar, pero cada mejora puede consumir ensayos reales. El aprendizaje por refuerzo basado en modelo reutiliza cada transición para entrenar un predictor y evalúa muchas secuencias candidatas en dicho predictor. Si el predictor tiene un sesgo sistemático, el planificador optimiza un atajo exclusivo del simulador.

Aspecto Sin modelo Basado en modelo
Datos de hardware Eficiencia baja a media Media a alta dentro del rango del modelo
Tiempo de ejecución Inferencia de políticas a menudo ligera Implementaciones y optimización en cada ciclo
Restricciones Generalmente una capa indirecta de recompensa/seguridad Natural para incluir en el problema de planificación
Fallo principal Extrapolación deficiente a partir de datos dispersos Error del modelo a largo plazo
Ajuste típico Políticas de contacto y visuales complejas Planificación de movimiento, energía y térmica a corto plazo

Las pilas híbridas son comunes: una política aprendida propone candidatos, un modelo aprendido predice un horizonte corto y el MPC impone restricciones de velocidad, fuerza y corriente. Utilice el artículo PPO/SAC y el artículo MPC para asignar responsabilidades de temporización y seguridad en lugar de tratar los algoritmos como sustitutos.

No condense la incertidumbre en un solo número

La incertidumbre epistémica proviene de la falta de datos de entrenamiento; la incertidumbre aleatoria proviene de la variación irreducible de los sensores y del entorno. La varianza del conjunto es una señal útil para la primera, pero un conjunto aún puede compartir el mismo sesgo. Cuando la varianza predictiva supera un umbral, acorte el horizonte, reduzca la velocidad, cambie a un controlador clásico o recopile otra observación antes de planificar. Esta política de abstención debe especificarse antes de la implementación.

Para el residuo de un paso e_t=s_{t+1}-\hat s_{t+1}, cuantiles logarítmicos y peor caso casos además del error cuadrático medio. Un error promedio bajo puede ocultar un error grande justo antes del contacto. Nunca interprete un intervalo de predicción probabilístico como un certificado de seguridad; mantenga monitores independientes de colisión, fuerza, temperatura y corriente.

Experimentos de identificación de diseño

La identificación del sistema es un problema de diseño experimental, no una calibración única. Para un motor, mida por separado la fricción estática, la inercia a varias velocidades, el par dependiente de la carga y el retardo de ida y vuelta de la comunicación. Para un actuador hidráulico, registre la presión, el caudal, la velocidad del cilindro, la temperatura del aceite y el comando de la válvula en un mismo reloj. Divida los datos por día, piso, carga útil, iluminación y temperatura (no por fotogramas vecinos aleatorios) para que el conjunto final sea realmente desconocido.

Una pequeña intuición numérica

Considere un carrito de 1 kg cuya velocidad cambia en 0.1u cada T_s=0.1\,\mathrm{s}. Un modelo sin fricción predice un aumento de velocidad de 0.5\,\mathrm{m/s} para u=1 en cinco pasos. Si el carrito real pierde Por cada paso hasta la fricción, el error de cinco pasos alcanza 0.02\,\mathrm{m/s}. Un horizonte más corto, la identificación en línea, el margen en la restricción de velocidad y la replanificación a partir de la medición mantienen la utilidad de este modelo simple.

Evidencia para publicar

Junto con las ecuaciones, conserve el período de entrenamiento, la frecuencia del sensor, el retardo, la semilla aleatoria, los parámetros del entorno, el plazo del solucionador y la política de reserva. Represente gráficamente los residuos de predicción, las violaciones de restricciones, la distancia de parada y la abstención activada por incertidumbre con el mismo ID de experimento que la recompensa. Si no se pueden compartir los registros sin procesar, publique estadísticas anonimizadas, la configuración de la simulación, las unidades y una fecha de referencia para que el alcance de la afirmación siga siendo verificable.

Verifique su comprensión
¿Garantiza un modelo aprendido despliegues largos y fiables?

Los pequeños errores del modelo se acumulan en las predicciones. Verifique la duración del despliegue, los estados desconocidos y la validación en el entorno real. entorno.

Referencias

Tipos de modelos del mundo y planificadores

Los modelos físicos son interpretables, pero pueden presentar dificultades con el contacto; los modelos latentes y de conjunto pueden ser eficientes, pero requieren validación con respecto a la seguridad en el espacio real. Las acciones candidatas pueden usar disparos, CEM o MPC diferenciable, con una alternativa de plazo límite.

Higiene del conjunto de datos

Marque los sensores saturados, los errores de tiempo, las intervenciones de limitadores, los valores interpolados y las causas terminales. Mantenga el conjunto de evaluación inmutable para que una actualización del modelo no pueda ocultar una regresión.

Límites de la evidencia

La precisión de la predicción, la recompensa y el comportamiento seguro del hardware son afirmaciones independientes. Publique la métrica, la condición de prueba y la capa de seguridad responsable para cada una.

What to read next

Review the backgroundIntroducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.Continue the seriesIntroducción al aprendizaje por refuerzo: aprendizaje por imitación y aprendizaje por refuerzo inverso.Explore another aspect of this fieldIntroducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.