Contents — find the section you need

Apprendre à un robot à poser une tasse en toute sécurité, à éviter une personne dans une allée étroite ou à utiliser un outil complexe est souvent plus difficile qu'il n'y paraît, car la récompense est difficile à définir. Récompenser la distance parcourue jusqu'à un objectif peut inciter à déplacer des objets ; ne récompenser que la réussite finale peut rendre l'exploration inutile. L'apprentissage par imitation utilise des démonstrations humaines, des téléopérateurs ou une politique existante pour apprendre des actions à partir d'observations. L'apprentissage par renforcement inverse (IRL), quant à lui, tente de déduire l'objectif – ou la récompense – qui rend le comportement démontré cohérent, puis d'en déduire une politique pour cet objectif.

Aucune de ces méthodes n'est sûre du seul fait qu'elle utilise des données humaines. Les questions centrales sont : que fait une politique dans les états absents des démonstrations ? Comment les étiquettes sont-elles horodatées et attribuées ? Comment les échecs sont-ils collectés ? Et qu'est-ce qui limite indépendamment une action physique ? Cet article établit des liens entre le clonage de comportement (BC), le décalage de covariables, DAgger, l'IRL, les modèles vision-langage-action, l'évaluation, la sécurité et la provenance des données. Voir Principes de base de l'apprentissage par renforcement, PPO et SAC et Introduction à VLA pour des concepts connexes.

Conclusion pratique

  • BC est un apprentissage supervisé partant de l'état démontré s vers l'action experte a. Il est rapide au démarrage, mais une petite erreur initiale peut amener la politique vers une distribution d'états jamais rencontrée.

  • DAgger exécute la politique actuelle dans un environnement contrôlé, interroge un expert sur l'action à entreprendre dans les états que la politique visite réellement, agrège ces étiquettes et réentraîne le modèle. Il transforme les erreurs en données, mais nécessite une exécution sécurisée et une intervention experte fiable. - L'apprentissage par renforcement intrinsèque (IRL) estime une récompense r_\theta(s,a) à partir de démonstrations, puis optimise une politique en conséquence. La récompense n'est pas identifiée de manière unique ; elle est déterminée par le comportement dans des conditions contrôlées et des contraintes de sécurité explicites, et non par une carte thermique d'apparence plausible.

  • Un langage d'apprentissage visuel (VLA) peut constituer une politique d'imitation conditionnelle étendue, mais le langage et l'échelle de l'image ne suppriment pas les limites physiques, le timing, la sécurité des contacts ni la trajectoire d'arrêt sécurisée.

Les démonstrations sont des enregistrements opérationnels, et non de simples vidéos

Une démonstration exploitable combine des observations (images, profondeur, force, état des articulations), des actions (commande articulaire, vitesse, préhension, arrêt), des horodatages, des images clés, des instructions de tâche, des résultats (succès/échec), l'opérateur, les conditions environnementales et les événements d'intervention. Si la commande enregistrée correspond à ce qui est arrivé au robot après un délai de transport, et non à ce que l'opérateur avait prévu, ce délai doit être inclus dans l'ensemble de données. Un décalage de 100 ms entre l'image et le bras transforme un comportement correct en paires d'entraînement incohérentes.

La provenance des données inclut le consentement du collecteur, l'autorisation relative à l'environnement d'enregistrement, le respect de la vie privée, les œuvres de tiers, la responsabilité en matière de sécurité des robots et la possibilité de retracer un échantillon jusqu'à sa source. L'utilisation conjointe d'un jeu de données public exige la vérification de la licence, des conditions d'utilisation commerciale, des conditions de redistribution, des informations relatives aux personnes et aux enregistrements audio, ainsi que de l'étalonnage pour l'usage prévu. « Trouvé sur Internet » ne constitue pas une preuve de provenance ; cela signifie l'absence de consentement et de conditions traçables.

Diagram 1 · Use the button to switch views
Apprenez des démonstrations ; États visités agrégés

Diagramme : Duskcoil, conceptuel. Un déploiement correspond à une collecte de données réelle ; le diagramme n'implique pas que la surveillance de la sécurité, la logique d'arrêt ou l'intervention de l'opérateur puissent être omises.

Clonage comportemental et décalage de covariables

Étant donné les paires d'experts D=\{(s_i,a_i^*)\}_{i=1}^N, le clonage comportemental à action continue peut minimiser

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

Les actions discrètes utilisent l'entropie croisée. Si plusieurs actions sont valides, une seule prédiction d'erreur quadratique peut faire la moyenne de « passer à gauche » et « passer à droite » en une action intermédiaire non sécurisée ; les distributions conditionnelles, les modèles de mélange ou les politiques de type diffusion peuvent représenter plusieurs modes. Le contexte, le style de l'opérateur et les instructions de la tâche sont importants.

Le clonage comportemental est intéressant car il peut être entraîné hors ligne avant la conception des récompenses ou l'exploration. Sa principale faiblesse est que les démonstrations proviennent de la distribution d'états experts d_{\pi^*}(s) tandis que le déploiement produit d_{\pi_\theta}(s). Les erreurs modifient l'observation suivante et peuvent s'amplifier. Dans des analyses simplifiées, une erreur initiale \epsilon peut atteindre l'ordre O(T^2\epsilon) sur un horizon séquentiel T ; la limite exacte dépend des hypothèses, mais le point causal est durable : une politique génère ses propres entrées futures.

DAgger : agrégation des étiquettes selon le parcours de l'apprenant

L'agrégation des données exécute la politique apprise dans des conditions contrôlées, demande l'action experte souhaitée a^* à l'état s effectivement visité, ajoute la paire à D et réentraîne le modèle. Des combinaisons de politiques peuvent être utilisées lors des itérations. La méthode rapproche la distribution d'entraînement de la distribution de déploiement.

DAgger n'autorise pas les défaillances d'un robot en public. Il est recommandé de commencer par une simulation, une vitesse réduite, des protections physiques, un arrêt d'urgence à distance, une prise de contrôle immédiate par un expert et un filtre de sécurité des actions. Les étiquettes peuvent correspondre aux actions physiquement réalisées par l'expert ou à des réponses contrefactuelles à la question « que se serait-il passé ? ». ici?" Cette dernière approche peut s'avérer précieuse, mais elle augmente la charge de travail des experts, la latence et la variabilité subjective. La collecte des données doit être planifiée en fonction des modes de défaillance non détectés, et non uniquement du nombre de lignes.

IRL : inférer l'objectif plutôt que de copier l'action

L'IRL estime la récompense r_\theta(s,a) ou r_\theta(s,a,s') à partir de la politique experte \pi_E. L'intuition de l'entropie maximale est que les trajectoires expertes favorisent une récompense élevée sans être inutilement déterministes parmi des trajectoires tout aussi performantes. Conceptuellement, la probabilité de la trajectoire \tau est :

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

La mise à jour de \theta pour augmenter la vraisemblance de la trajectoire experte produit une récompense qui peut être associée à l'apprentissage par renforcement (RL) ou à la commande optimale. Cette approche peut mieux s'adapter que la commande comportementale directe (BC) aux nouveaux états initiaux ou contraintes, car l'objectif peut être réoptimisé.

Cependant, plusieurs récompenses peuvent expliquer les mêmes démonstrations ; les contraintes non observées et les habitudes de l'opérateur peuvent être intégrées à un comportement appris. Récompense. Une récompense expliquant les trajectoires d'entraînement peut se généraliser de manière dangereuse. Les méthodes de type GAIL, quant à elles, font correspondre les distributions d'occupation des experts et des apprenants grâce à un discriminateur. Aucune de ces formulations ne justifie l'apprentissage d'une interdiction (collision, force de pincement, zone d'exclusion humaine) par simple inférence. Les règles de sécurité explicites restent explicites.

Lien avec le VLA

Un modèle Vision-Langage-Action conditionne l'action suivante ou un segment d'action en fonction des images, du langage et de l'état du robot. Au sens large, il s'agit d'une imitation conditionnelle à grande échelle. Son éventail d'objets et de langage ne garantit pas l'extrapolation à de nouvelles conditions d'éclairage, de friction, de positionnement de la caméra, d'instructions ambiguës ou de limites de force de contact. Un VLA interprétant « poser la tasse sur l'étagère » ne certifie pas en soi la force, la distance de collision, l'amplitude articulaire ou la distance d'arrêt ; voir Introduction au VLA.

Validez le repère, les unités, la vitesse, l'accélération et la fraîcheur de l'information avant qu'une action n'atteigne un actionneur. Tractez-la à travers la cinématique, la vérification des collisions et une Contrôleur d'impédance ou de position/vitesse. Un langage ambigu doit déclencher une clarification, un refus ou un mode basse vitesse ; une perception dégradée doit interrompre l'exécution. L'échelle des données ne remplace pas une limite de sécurité physique.

Évaluation, sécurité et provenance

Ne pas approuver une politique sur la seule base d'une erreur d'action hors ligne. Effectuer des évaluations indépendantes sur la pose initiale, les objets, l'éclairage, les arrière-plans, le frottement, la latence, la formulation des instructions et les perturbations. Signaler les succès, les collisions, les arrêts, le nombre d'interventions, la force maximale, le temps d'exécution et les cas les plus défavorables observés. Un taux de réussite moyen élevé ne compense pas les risques humains ou matériels rares. Suivre chaque itération DAgger, démonstration de la source, étiqueteur, division, modèle, seuils, échecs et chemin de restauration.

Couche Vérifier Réponse à l'échec
Données consentement, licence, heure, trame, provenance succès/échec quarantaine, réétiquetage, arrêt d'utilisation
Politique états indépendants, décalage, incertitude d'action ralentir, interroger un expert, se remémorer
Actionnement limites, fréquence, collision, force Communication Filtre de sécurité, arrêt, arrêt d'urgence

Opérations | Supervision, récupération, journaux, contrôle des modifications | Restauration et analyse des causes profondes |

Vérifiez votre compréhension
L'imitation permet-elle de retrouver les raisons du démonstrateur ?

Reproduire un comportement et inférer une récompense sont deux tâches différentes. Plusieurs récompenses peuvent expliquer un même comportement ; examinez donc les hypothèses de l'apprentissage par renforcement.

Références

What to read next

Review the backgroundApprentissage par renforcement basé sur un modèle et passage de la simulation au réelContinue the seriesπ0 expliqué — Comment la correspondance des flux a changé la génération d'actions VLAExplore another aspect of this fieldIntroduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi