Contents — find the section you need

Enseñar a un robot a colocar una taza de forma segura, evitar a una persona en un pasillo estrecho o manejar una herramienta compleja suele ser más difícil de lo que parece, ya que la recompensa es difícil de especificar. Recompensar la distancia a un objetivo puede incentivar el desplazamiento de objetos; recompensar únicamente el éxito final puede no proporcionar una señal útil para la exploración. El aprendizaje por imitación utiliza demostraciones de personas, teleoperadores o una política existente para aprender acciones a partir de observaciones. El aprendizaje por refuerzo inverso (IRL), en cambio, intenta inferir el objetivo —o la recompensa— que da sentido al comportamiento demostrado, y luego deriva una política para dicho objetivo.

Ninguno de los dos métodos se vuelve seguro simplemente por usar datos humanos. Las preguntas centrales son qué hace una política en estados ausentes de las demostraciones, cómo se cronometran y atribuyen las etiquetas, cómo se registran los fallos y qué limita de forma independiente una acción física. Este artículo relaciona la clonación de comportamiento (BC), el cambio de covariables, DAgger, IRL, los modelos de visión-lenguaje-acción, la evaluación, la seguridad y la procedencia de los datos. Consulte Conceptos básicos de aprendizaje por refuerzo, PPO y SAC y Introducción a VLA para ver conceptos relacionados.

Conclusión práctica

  • BC es un aprendizaje supervisado desde el estado demostrado s hasta la acción del experto a. Su inicio es rápido, pero un pequeño error inicial puede llevar la política a una distribución de estados desconocida.

  • DAgger ejecuta la política actual en un entorno controlado, solicita a un experto la acción en los estados que la política visita realmente, agrega esas etiquetas y reentrena. Convierte los modos de fallo en datos, pero requiere una ejecución segura y una intervención experta fiable.

  • IRL estima una recompensa r_\theta(s,a) a partir de demostraciones y luego optimiza una política para ella. La recompensa no se identifica de forma unívoca; se evalúa según el comportamiento en condiciones controladas y con restricciones de seguridad explícitas, no mediante un mapa de calor que parezca plausible.

  • Un VLA puede ser una política de imitación condicional amplia, pero el lenguaje y la escala de la imagen no eliminan los límites físicos, la sincronización, la seguridad de contacto ni una ruta de parada segura.

Las demostraciones son registros operativos, no solo vídeos

Una demostración útil combina observaciones (imágenes, profundidad, fuerza, estado de las articulaciones), acciones (comando de articulación, velocidad, pinza, parada), marcas de tiempo, fotogramas, instrucciones de la tarea, éxito/fracaso, operador, condiciones ambientales y eventos de intervención. Si el comando registrado es el que llegó al robot tras un retraso en el transporte, en lugar de la intención del operador, dicho retraso debe incluirse en el conjunto de datos. Un desfase de 100 ms entre la imagen y el brazo convierte el comportamiento correcto en pares de entrenamiento inconsistentes.

La procedencia de los datos incluye el consentimiento del recolector, el permiso para el entorno de grabación, la privacidad, las obras de terceros, la responsabilidad de la seguridad del robot y la capacidad de rastrear una muestra hasta su origen. Mezclar un conjunto de datos público requiere verificar la licencia, los términos de uso comercial, la redistribución, las personas y el audio, y la calibración para el uso previsto. "Encontrado en internet" no es procedencia; es la ausencia de consentimiento y términos rastreables.

Diagram 1 · Use the button to switch views
Aprende de las demostraciones

Diagrama: Duskcoil, conceptual. Un despliegue es una recopilación de datos reales; el diagrama no implica que se puedan omitir la monitorización de seguridad, la lógica de parada o la intervención del operador.

Clonación de comportamiento y cambio de covariables

Dados pares de expertos D=\{(s_i,a_i^*)\}_{i=1}^N, la clonación de comportamiento de acción continua puede minimizar

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

Las acciones discretas utilizan la entropía cruzada. Si hay más de una acción válida, una única predicción de error cuadrático puede promediar "pasar a la izquierda" y "pasar a la derecha" en una acción intermedia insegura; las distribuciones condicionales, los modelos de mezcla o las políticas de difusión pueden representar múltiples modos. El contexto, el estilo del operador y las instrucciones de la tarea son importantes.

La clonación de comportamiento es atractiva porque se puede entrenar sin conexión antes del diseño de la recompensa o la exploración. Su principal debilidad es que las demostraciones provienen de la distribución de estados de los expertos d_{\pi^*}(s), mientras que el despliegue produce d_{\pi_\theta}(s). Pequeños errores El cambio puede modificar la siguiente observación y acumularse. En análisis simplificados, el error de un paso \epsilon puede crecer hasta el orden O(T^2\epsilon) en un horizonte secuencial T; el límite exacto depende de las suposiciones, pero el punto causal es duradero: una política crea sus propias entradas futuras.

DAgger: agrega etiquetas donde el aprendiz va

La agregación de conjuntos de datos ejecuta la política aprendida bajo condiciones controladas, solicita la acción experta deseada a^* en el estado s visitado realmente, agrega el par a D y vuelve a entrenar. Se pueden usar combinaciones de políticas durante las iteraciones. El método acerca la distribución del entrenamiento a la distribución de la implementación.

DAgger no es una autorización absoluta para que un robot falle en público. Comience con simulación, baja velocidad, guardias físicos, parada de emergencia remota, toma de control inmediata por parte del experto y un filtro de seguridad de acciones. Las etiquetas pueden ser acciones que el experto realizó físicamente o respuestas contrafactuales a "¿qué debería haber sucedido?". ¿aquí?" Esto último puede ser valioso, pero aumenta la carga de trabajo del experto, la latencia y la variabilidad subjetiva. Planifique la recopilación de datos en función de los modos de fallo detectados, no solo del número de filas.

IRL: inferir el objetivo en lugar de copiar la acción

IRL estima la recompensa r_\theta(s,a) o r_\theta(s,a,s') a partir de la política del experto \pi_E. La intuición de máxima entropía sugiere que las trayectorias del experto favorecen una alta recompensa sin ser innecesariamente deterministas entre trayectorias igualmente buenas. Conceptualmente, la probabilidad de la trayectoria \tau es:

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

Actualizar \theta para aumentar la probabilidad de la trayectoria del experto produce una recompensa que puede combinarse con RL o control óptimo. Esto puede adaptarse mejor que el BC directo a nuevos estados iniciales o restricciones, ya que el objetivo puede reoptimizarse.

Sin embargo, muchas recompensas pueden explicar las mismas demostraciones; las restricciones no observadas y los hábitos del operador pueden ser absorbidos. en una recompensa aprendida. Una recompensa que explique las trayectorias de entrenamiento puede generalizarse peligrosamente. Los métodos tipo GAIL, en cambio, comparan las distribuciones de ocupación de expertos y aprendices mediante un discriminador. Ninguna formulación justifica aprender una prohibición (colisión, fuerza de pinza, zona de exclusión humana) solo por inferencia. Las reglas de seguridad explícitas siguen siendo explícitas.

Conexión con VLA

Un modelo de Visión-Lenguaje-Acción (VLA) condiciona la siguiente acción o un fragmento de acción a imágenes, lenguaje y el estado del robot. En un sentido amplio, se trata de una imitación condicional a gran escala. Su rango de objetos y lenguaje no garantiza la extrapolación a nueva iluminación, fricción, ubicación de la cámara, instrucciones ambiguas o límites de fuerza de contacto. Un VLA que interpreta "pon la taza en el estante" no certifica por sí mismo la fuerza, la distancia de colisión, el rango de movimiento de las articulaciones ni la distancia de frenado; véase Introducción a VLA.

Validar el sistema de coordenadas, las unidades, la velocidad, la aceleración y la actualidad antes de que una acción llegue a un actuador. Dirigirla a través de la cinemática, la comprobación de colisiones y un Controlador de impedancia o posición/velocidad. El lenguaje ambiguo debe activar la aclaración, el rechazo o el modo de baja velocidad; la percepción degradada debe detener la ejecución. La escala de datos no sustituye un límite de seguridad físico.

Evaluación, seguridad y procedencia

No apruebe una política basándose únicamente en errores de acción fuera de línea. Cree evaluaciones de reserva sobre la pose inicial, los objetos, la iluminación, los fondos, la fricción, la latencia, la redacción de las instrucciones y las perturbaciones. Informe sobre el éxito, la colisión, la parada, el recuento de intervenciones, la fuerza máxima, el tiempo de finalización y los peores casos observados. Un alto promedio de éxito no absorbe el riesgo humano o del equipo poco frecuente. Realice un seguimiento de cada iteración de DAgger, demostración de origen, etiquetador, división, modelo, umbrales, fallos y ruta de reversión.

Capa Verificar Respuesta a fallos
Datos consentimiento, licencia, tiempo, marco, procedencia de éxito/fracaso cuarentena, reetiquetado, suspensión de uso
Política estados de reserva, cambio, incertidumbre de la acción lento, consulta a un experto, recopilación
Actuación límites, Velocidad, colisión, fuerza, comunicación Filtro de seguridad, parada, parada de emergencia
Operaciones Supervisor, recuperación, registros, control de cambios Reversión y análisis de la causa raíz
Comprueba tu comprensión
¿La imitación recupera las razones del demostrador?

Reproducir un comportamiento e inferir una recompensa son tareas diferentes. Múltiples recompensas pueden explicar el mismo comportamiento, por lo que conviene examinar las suposiciones del aprendizaje por refuerzo.

Referencias

What to read next

Review the backgroundAprendizaje por refuerzo basado en modelos y de simulación a la realidad.Continue the seriesExplicación de π0: cómo la coincidencia de flujo cambió la generación de acciones de VLAExplore another aspect of this fieldIntroducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.