Contents — find the section you need
En resumen
El aprendizaje por refuerzo basado en modelos (MBRL) aprende un modelo del mundo \hat f, que relaciona el estado y la acción con un estado siguiente previsto, prueba secuencias de acciones dentro de él y aplica únicamente una acción supervisada al hardware. Los métodos sin modelo aprenden una política directamente a partir de la recompensa; el MBRL puede ser más eficiente en el uso de datos y puede expresar restricciones, pero un error en el modelo puede generar éxitos solo en el simulador. Consulte Conceptos básicos de RL, Aprendizaje Q, PPO/SAC y MPC.
Modelos y planificación mundiales
Figura 1 — SVG conceptual creado por Duskcoil, no datos del sistema medidos.
Aprender \hat s_{t+1}=\hat f_\theta(s_t,a_t) y optimizar un objetivo de horizonte deslizante:
Simulación a la realidad, identificación y seguridad
Los errores de un solo paso se acumulan en implementaciones prolongadas. Los conjuntos de modelos pueden estimar la incertidumbre; los planificadores pueden evitar regiones de alta varianza y utilizar horizontes temporales cortos. La aleatorización del dominio varía la masa, la fricción, el retardo, el ruido del sensor, la iluminación y la posición de la cámara. La identificación del sistema mide la inercia, la fricción, las constantes del motor y la latencia, de modo que estos rangos sean defendibles en lugar de arbitrarios.
Paso del registro de eventos al control de sombra a baja velocidad y a ensayos supervisados limitados. Mantener la parada de emergencia, los monitores independientes de velocidad/fuerza/temperatura, la parada por pérdida de comunicación y la separación humana fuera de la política aprendida. Los fallos comunes incluyen simulaciones de fricción fija que provocan deslizamiento de las ruedas, sobreajuste de la iluminación, manipulación de recompensas que genera vibraciones y retardo no modelado que causa inestabilidad. Informar sobre el número de infracciones, la distancia de frenado y la incertidumbre activada. Abstención y comportamiento en el peor de los casos: no solo recompensa media.
Roles sin modelo y basados en modelo
El aprendizaje por refuerzo sin modelo actualiza una política o valor directamente a partir de la experiencia. Es expresivo cuando la dinámica de contacto es difícil de modelar, pero cada mejora puede consumir ensayos reales. El aprendizaje por refuerzo basado en modelo reutiliza cada transición para entrenar un predictor y evalúa muchas secuencias candidatas en dicho predictor. Si el predictor tiene un sesgo sistemático, el planificador optimiza un atajo exclusivo del simulador.
| Aspecto | Sin modelo | Basado en modelo |
|---|---|---|
| Datos de hardware | Eficiencia baja a media | Media a alta dentro del rango del modelo |
| Tiempo de ejecución | Inferencia de políticas a menudo ligera | Implementaciones y optimización en cada ciclo |
| Restricciones | Generalmente una capa indirecta de recompensa/seguridad | Natural para incluir en el problema de planificación |
| Fallo principal | Extrapolación deficiente a partir de datos dispersos | Error del modelo a largo plazo |
| Ajuste típico | Políticas de contacto y visuales complejas | Planificación de movimiento, energía y térmica a corto plazo |
Las pilas híbridas son comunes: una política aprendida propone candidatos, un modelo aprendido predice un horizonte corto y el MPC impone restricciones de velocidad, fuerza y corriente. Utilice el artículo PPO/SAC y el artículo MPC para asignar responsabilidades de temporización y seguridad en lugar de tratar los algoritmos como sustitutos.
No condense la incertidumbre en un solo número
La incertidumbre epistémica proviene de la falta de datos de entrenamiento; la incertidumbre aleatoria proviene de la variación irreducible de los sensores y del entorno. La varianza del conjunto es una señal útil para la primera, pero un conjunto aún puede compartir el mismo sesgo. Cuando la varianza predictiva supera un umbral, acorte el horizonte, reduzca la velocidad, cambie a un controlador clásico o recopile otra observación antes de planificar. Esta política de abstención debe especificarse antes de la implementación.
Para el residuo de un paso e_t=s_{t+1}-\hat s_{t+1}, cuantiles logarítmicos y peor caso casos además del error cuadrático medio. Un error promedio bajo puede ocultar un error grande justo antes del contacto. Nunca interprete un intervalo de predicción probabilístico como un certificado de seguridad; mantenga monitores independientes de colisión, fuerza, temperatura y corriente.
Experimentos de identificación de diseño
La identificación del sistema es un problema de diseño experimental, no una calibración única. Para un motor, mida por separado la fricción estática, la inercia a varias velocidades, el par dependiente de la carga y el retardo de ida y vuelta de la comunicación. Para un actuador hidráulico, registre la presión, el caudal, la velocidad del cilindro, la temperatura del aceite y el comando de la válvula en un mismo reloj. Divida los datos por día, piso, carga útil, iluminación y temperatura (no por fotogramas vecinos aleatorios) para que el conjunto final sea realmente desconocido.
Una pequeña intuición numérica
Considere un carrito de 1 kg cuya velocidad cambia en 0.1u cada T_s=0.1\,\mathrm{s}. Un modelo sin fricción predice un aumento de velocidad de 0.5\,\mathrm{m/s} para u=1 en cinco pasos. Si el carrito real pierde Por cada paso hasta la fricción, el error de cinco pasos alcanza 0.02\,\mathrm{m/s}. Un horizonte más corto, la identificación en línea, el margen en la restricción de velocidad y la replanificación a partir de la medición mantienen la utilidad de este modelo simple.
Evidencia para publicar
Junto con las ecuaciones, conserve el período de entrenamiento, la frecuencia del sensor, el retardo, la semilla aleatoria, los parámetros del entorno, el plazo del solucionador y la política de reserva. Represente gráficamente los residuos de predicción, las violaciones de restricciones, la distancia de parada y la abstención activada por incertidumbre con el mismo ID de experimento que la recompensa. Si no se pueden compartir los registros sin procesar, publique estadísticas anonimizadas, la configuración de la simulación, las unidades y una fecha de referencia para que el alcance de la afirmación siga siendo verificable.
¿Garantiza un modelo aprendido despliegues largos y fiables?
Los pequeños errores del modelo se acumulan en las predicciones. Verifique la duración del despliegue, los estados desconocidos y la validación en el entorno real. entorno.
Referencias
Tipos de modelos del mundo y planificadores
Los modelos físicos son interpretables, pero pueden presentar dificultades con el contacto; los modelos latentes y de conjunto pueden ser eficientes, pero requieren validación con respecto a la seguridad en el espacio real. Las acciones candidatas pueden usar disparos, CEM o MPC diferenciable, con una alternativa de plazo límite.
Higiene del conjunto de datos
Marque los sensores saturados, los errores de tiempo, las intervenciones de limitadores, los valores interpolados y las causas terminales. Mantenga el conjunto de evaluación inmutable para que una actualización del modelo no pueda ocultar una regresión.
Límites de la evidencia
La precisión de la predicción, la recompensa y el comportamiento seguro del hardware son afirmaciones independientes. Publique la métrica, la condición de prueba y la capa de seguridad responsable para cada una.
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.