Contents — find the section you need
L'apprentissage par renforcement (RL) permet à un robot d'apprendre quelles actions sont les plus rentables sur le long terme en interagissant avec son environnement. Contrairement à la classification d'images, où une entrée et une étiquette arrivent simultanément, le robot observe le monde, actionne un moteur et reçoit une récompense, souvent quelques secondes plus tard. La boucle essentielle est la suivante : essayer, observer le résultat et mettre à jour la politique.
Résumé en 30 secondes
-
La plus petite transition RL est, à l'instant t, l'état (ou observation) s_t, l'action a_t, la récompense r_{t+1} et l'état suivant s_{t+1}.
-
Un processus de décision markovien (MDP) modélise comment l'état et l'action actuels déterminent l'état et la récompense suivants. L'état doit résumer l'historique de manière suffisamment précise pour permettre la prédiction.
-
Une politique \pi(a\mid s) choisit les actions. La fonction de valeur V^\pi(s) représente le rendement futur attendu lorsque cette politique est appliquée.
-
Le rendement actualise les récompenses futures avec \gamma. Un horizon trop long peut déstabiliser l'apprentissage, tandis qu'un horizon trop court produit un robot à courte vue et dangereux.
-
L'exploration consiste à tester des actions incertaines ; l'exploitation choisit l'action actuellement considérée comme la meilleure. Sur le plan matériel, les contraintes de sécurité prévalent sur les deux.
1. Considérer le robot comme un agent
Figure 1 — Après l'action d'un agent, l'environnement change et renvoie l'observation et la récompense suivantes. Un robot réel ajoute à cette boucle le délai de communication, le bruit des capteurs et la saturation des actionneurs.
Pour un robot à entraînement différentiel, l'agent peut utiliser les données de la caméra, du LiDAR et de l'encodeur comme état et générer les vitesses des roues gauche et droite comme actions. L'environnement inclut la dynamique du véhicule, le frottement du sol, les obstacles et l'état de la batterie. Se déplacer vers un objectif peut rapporter une récompense, tandis qu'une collision ou un changement de direction brusque peut être pénalisé. Un simple signal « +1 à l'objectif » est généralement trop simpliste ; la distance, la vitesse, la marge d'arrêt et l'énergie doivent être considérées conjointement.
2. MDP : décomposer le problème en composantes
Un MDP est défini par un espace d'états \mathcal{S}, un espace d'actions \mathcal{A}, une probabilité de transition P(s'\mid s,a), une fonction de récompense R(s,a,s') et un facteur d'actualisation \gamma :
Lorsque l'agent choisit l'action a_t dans l'état s_t, l'environnement passe à l'état suivant s_{t+1} selon P et renvoie la récompense r_{t+1}=R(s_t,a_t,s_{t+1}).
« Markovien » signifie qu'une fois l'état actuel connu, le passé n'apporte plus d'informations nécessaires à la prédiction de l'avenir. Un robot mobile dont l'état ne contient que sa position ne peut pas distinguer un robot arrêté d'un robot en mouvement au même endroit. Incluez la vitesse, la vitesse angulaire et la fiabilité des capteurs, ou utilisez un modèle récurrent qui conserve l'historique.
Lorsque l'état complet s_t ne peut être observé directement, le problème est un processus de décision markovien partiellement observable (POMDP). Presque tous les robots réels sont des POMDP en raison des occlusions et des données LiDAR manquantes. Un estimateur d'état (un filtre de Kalman étendu, un graphe de facteurs ou un modèle appris) transforme les observations o_t en un état interne exploitable. L'article sur la fusion de capteurs explique cette limite, et le guide ROS 2 montre comment en faire un composant logiciel reproductible.
3. Fonctions de valeur et retour
La somme actualisée des récompenses à partir de l'instant t correspond au retour G_t :
La valeur de l'état s sous la politique \pi est :
et la valeur état-action spécifie également la première action :
La sélection de la valeur Q la plus élevée relève d'une conception basée sur la valeur. La mise à jour directe des paramètres \theta d'une politique neuronale \pi_\theta(a\mid s) relève également d'une conception basée sur la politique. Les angles de braquage continus et les couples articulaires sont souvent privilégiés par les méthodes de gradient de politique ou d'acteur-critique, car il est impossible d'énumérer toutes les actions possibles.
4. L'équation de Bellman décompose un horizon long en une étape
Au lieu d'évaluer l'avenir dans son intégralité d'un seul coup, on le divise en la récompense immédiate et la valeur à l'étape suivante. L'équation d'espérance de Bellman est :
La valeur optimale V^*(s) obéit à l'équation d'optimalité de Bellman :
C'est pourquoi une valeur cible peut être générée à partir d'autres estimations plutôt que d'une étiquette fournie par un humain. L'auto-référence est également une source d'instabilité. Les réseaux cibles, la relecture d'expérience et la normalisation des récompenses permettent de dissocier les anciennes estimations de la mise à jour actuelle et de réduire les corrélations nuisibles.
5. Équilibrer exploration et exploitation
Choisir systématiquement l'action avec l'estimation la plus élevée peut enfermer l'agent dans une solution locale chanceuse. L'exploration teste des actions inconnues, mais les mouvements aléatoires sur une machine réelle peuvent provoquer une collision. Les choix courants sont :
| Méthode | Intuition | Force | Problème matériel |
|---|---|---|---|
| ε-glouton | Choix aléatoire avec probabilité ε | Simple | Les changements brusques sont dangereux pour un couple continu |
| Boltzmann/softmax | Échantillonnage proportionnel à la valeur | Privilégie les options prometteuses | Nécessite un réglage de la température |
| UCB | Essai d'actions à forte incertitude | Justification explicite de l'exploration | Nécessite des estimations d'incertitude |
| Politique bruitée | Ajout de bruit continu aux actions ou aux pondérations | Exploration plus fluide | Nécessite toujours une saturation et des limites |
Sur le matériel, limiter l'exploration à une plage de fonctionnement validée. Placer les limites de vitesse, les limites souples des articulations, les limites de force/courant, un système de surveillance et un arrêt d'urgence en dehors du module d'apprentissage afin que chaque sortie de politique puisse être interceptée. La randomisation dans un simulateur est utile ; elle n'autorise pas l'application de commandes aléatoires à une machine.
6. Tester l'idée dans un environnement à petite grille
Une grille 5×5 rend la dynamique d'apprentissage visible. Soit une cellule l'état, haut/bas/gauche/droite les actions, la récompense de l'objectif +1, un mur -0,1 et chaque étape -0,01. Initialisez Q à zéro et répétez la mise à jour par différence temporelle :
Le terme entre parenthèses représente l'erreur TD : la différence entre la prédiction et la cible à une étape. Si \alpha est trop grand, les nouvelles expériences prédominent ; s'il est trop petit, la politique ne peut pas suivre un environnement changeant. Enregistrez le taux de réussite, le nombre moyen d'étapes, le taux de collision et la proportion d'états non visités – et pas seulement une courbe de récompense.
7. Formulez la récompense comme une spécification
La conception de la récompense est souvent plus importante qu'un détail algorithmique. Un robot de livraison pourrait utiliser
pour combiner la progression, les collisions, l'énergie consommée et la fluidité. Augmenter un poids w n'améliore pas toujours le comportement. Si la pénalité de collision devient prépondérante, le robot risque d'apprendre la politique sûre, mais inutile, de ne jamais se déplacer. Il est essentiel d'enregistrer chaque terme séparément et de vérifier quel terme la politique optimise réellement.
La manipulation des récompenses constitue un autre mode de défaillance : un bug dans le détecteur d'objectif, un angle mort des capteurs ou une règle de contact spécifique au simulateur peuvent générer un score élevé sans pour autant accomplir la tâche prévue. Des objectifs compréhensibles par l'humain, des contraintes physiques et un environnement d'évaluation indépendant facilitent la détection de ces raccourcis.
8. Quand la recherche rencontre le produit
Les méthodes d'analyse de la valeur sont économes en données, mais supposent souvent des états et des actions discrets. Les gradients de politique et les méthodes acteur-critique gèrent le contrôle continu ; SAC ajoute un objectif d'entropie, tandis que l'apprentissage par renforcement basé sur un modèle planifie avec un modèle de dynamique appris ou analytique avant de déplacer le robot. Les méthodes basées sur un modèle peuvent réduire le nombre d'échantillons réels, mais elles doivent tolérer les erreurs de modélisation.
En production, l'apprentissage par renforcement n'est pas nécessairement appliqué à chaque couche, de la surveillance de la sécurité au courant moteur. Un PID ou un MPC classique peut définir la marge de sécurité tandis que l'apprentissage par renforcement (RL) sélectionne un contact de préhension, une préférence de trajectoire ou une courbe de gain. La présentation VLA décrit une limite similaire : un modèle vision-langage peut proposer des blocs d'actions tandis qu'un contrôleur bas niveau validé limite le couple et la vitesse.
9. Avant le passage au matériel
-
L'état inclut-il la vitesse, le délai et la fiabilité des capteurs, ou l'hypothèse de Markov a-t-elle été invalidée ?
-
Les termes de récompense sont-ils enregistrés séparément, avec le taux de collision, l'énergie, la régularité des entrées et la distance d'arrêt, en plus du taux de réussite ?
-
Les plages d'action, les limites de débit, les mécanismes de surveillance et les arrêts d'urgence sont-ils indépendants du modèle ?
-
Le frottement, la masse, le délai des capteurs, l'éclairage et la perte de paquets ont-ils été randomisés en simulation, et l'écart de distribution a-t-il été mesuré sur des journaux réels ?
-
Un ensemble d'évaluation non utilisé lors de l'entraînement est-il conservé séparément des données d'entraînement ? Les échecs sont-ils inclus plutôt que filtrés ? - Un redémarrage de processus permet-il d'atteindre un état sûr et d'éviter la réexécution d'une commande précédente ?
Résumé
L'apprentissage par renforcement ne permet pas à un robot de mémoriser un « mouvement correct ». Il définit les états, les actions, les transitions et les récompenses sous forme de processus de décision markovien (MDP), puis estime la valeur à long terme étape par étape à l'aide des équations de Bellman. L'exploration, la manipulation des récompenses et la sécurité matérielle doivent être intégrées à la conception du système avant qu'une politique apprise puisse quitter la simulation. Les prochains articles de cette série compareront l'apprentissage par renforcement Q/DQN, les gradients de politique, PPO et SAC, l'apprentissage par imitation et la transition de la simulation au réel dans ce même cadre.
L'action offrant la récompense immédiate la plus élevée est-elle toujours la meilleure ?
Les récompenses et les transitions futures peuvent modifier la réponse.
Distinguer la récompense immédiate du rendement actualisé. ## Références - [Richard S. Sutton et Andrew G. Barto, Reinforcement Learning: An Introduction (2e éd.)](http://incompleteideas.net/book/the-book-2nd.html) - [OpenAI Spinning Up — Key Concepts in RL](https://spinningup.openai.com/en/latest/spinningup/rl_intro.html) - [David Silver, Cours sur l'apprentissage par renforcement](https://www.davidsilver.uk/teaching/) - [Documentation officielle de ROS 2](https://docs.ros.org/en/rolling/) - [Robotics: Science and Systems — articles de recherche publics](https://roboticsconference.org/)
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.