Contents — find the section you need
La plupart des algorithmes d'apprentissage par renforcement (Q-learning, PPO, etc.) ont un point commun : maximiser la récompense. Autrement dit, si la fonction de récompense est mal conçue, aussi sophistiqué soit l'algorithme utilisé, un comportement non intentionnel deviendra la stratégie optimale. Comme évoqué dans les Fondements de l'apprentissage par renforcement, la conception de la récompense est le document de spécification externe à l'algorithme. En pratique, c'est généralement à cette étape que l'on consacre plus de temps qu'à la sélection de l'algorithme. Cet article aborde le compromis entre récompenses éparses et denses, la garantie théorique du façonnage de la récompense basé sur le potentiel, des cas avérés de manipulation de la récompense, l'apprentissage par renforcement inverse comme alternative, et le cadre de l'apprentissage par renforcement sûr et contraint.
Résumé en 30 secondes
-
Une récompense parcimonieuse (par exemple, +1 uniquement en cas de succès) est conforme à la spécification, mais l'apprentissage est lent ; une récompense dense (attribuant des points même pour les progrès intermédiaires) accélère l'apprentissage, mais risque de créer des raccourcis non intentionnels.
-
Le façonnage des récompenses est une technique permettant d'ajouter une récompense dense en toute sécurité, mais son ajout arbitraire risque de modifier la politique optimale elle-même. Le façonnage des récompenses basé sur le potentiel de Ng et al. (1999) garantit que la politique optimale reste inchangée, sous certaines conditions.
-
Le détournement des récompenses (ou manipulation des spécifications) est un phénomène où un agent se comporte exactement comme prévu par la spécification de la récompense, tout en obtenant des scores élevés grâce à des comportements très éloignés des intentions du concepteur. L'expérience CoastRunners d'OpenAI en est un exemple concret. L'apprentissage par renforcement inverse (IRL) estime la récompense à partir de données de démonstration, sans intervention humaine, et s'intègre directement au cadre présenté dans Imitation Learning and Inverse RL.
L'apprentissage par renforcement contraint et l'apprentissage par renforcement sûr pallient les limites d'une récompense unique, en privilégiant une conception qui maximise la récompense sans jamais enfreindre certaines contraintes.
1. Pourquoi la conception des récompenses est-elle « la partie la plus difficile » ?
Dans la définition du processus de décision markovien (MDP), les variables \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S et \mathcal A sont déterminées de manière quasi automatique à partir des spécifications des capteurs et des actionneurs. P correspond à la loi physique de l'environnement et n'est pas directement définie par le concepteur. Il ne reste donc que R(s,a,s') comme unique interface permettant de traduire l'intention du concepteur en une action exploitable par l'agent.
Cette traduction est étonnamment complexe. Une instruction suffisante entre deux personnes — « rangez ça correctement » — doit être formulée, sous forme de fonction de récompense, avec une précision numérique rigoureuse quant à ce qui est mesuré, à l'échelle de temps d'évaluation et à la pondération des différents objectifs (vitesse, sécurité, efficacité énergétique). L'agent ne comprend pas l'intention sous-jacente. Il se contente de maximiser l'équation telle qu'elle est écrite. Cette exigence de maximisation est la principale difficulté rencontrée lors de la conception de systèmes de récompense.
2. Récompenses éparses et récompenses denses
Les méthodes d'attribution de récompenses se divisent en deux grandes catégories : éparses et denses.
| Type | Modalités d'attribution | Avantages | Inconvénients |
|---|---|---|---|
| Récompense éparse | Récompense uniquement pour un résultat, comme la réussite ou l'échec (par exemple, +1 pour l'atteinte de l'objectif, 0 sinon) | Difficile de déformer l'intention du concepteur ; spécification fidèle | La phase d'essais et d'erreurs précédant toute récompense peut être longue, ralentissant parfois l'apprentissage, voire le bloquant. |
Récompenses fréquentes | Récompenses séquentielles pour les progrès intermédiaires (par exemple, une petite récompense positive à chaque réduction de la distance à l'objectif) | Un signal d'apprentissage est fréquemment émis, accélérant souvent la convergence | Un raccourci maximisant une métrique intermédiaire peut s'éloigner de l'objectif réel.
Par exemple, si l'on n'accorde à un robot mobile qu'une récompense sporadique (« +1 à l'atteinte de l'objectif, 0 sinon »), tant que la probabilité de tomber sur l'objectif par hasard est faible, aucun signal d'apprentissage n'arrivera. On est alors tenté d'ajouter des récompenses fréquentes (« une récompense à chaque réduction de la distance à l'objectif »). Mais si la distance est la seule récompense, il peut arriver qu'éviter un passage étroit et emprunter un détour permette une réduction de distance instantanée plus importante, rendant le détour « optimal ». Les récompenses fréquentes facilitent l'apprentissage, mais elles tendent aussi à inciter à maximiser une métrique non prévue par le concepteur.
3. Mise en forme des récompenses basée sur le potentiel : une méthode pour ajouter des récompenses sans modifier la politique optimale
La mise en forme des récompenses basée sur le potentiel (PBRS), présentée par Ng, Harada et Russell (1999), permet d'ajouter des récompenses denses en toute sécurité. Définissons une fonction de potentiel \Phi(s) sur les états, et définissons la récompense ajoutée comme la différence de potentiel avant et après une transition d'état.
Utilisons le même taux d'actualisation γ que pour le rendement initial. Sur T transitions, la somme de mise en forme actualisée est :
Annuler Φ aux états terminaux ne laisse subsister qu'une différence liée à l'état initial, évitant ainsi une préférence supplémentaire pour la longueur de l'épisode ou l'itinéraire. Pour un horizon infini, 0 ≤ γ < 1 et Φ borné annulent le terme terminal. Si le terme terminal varie selon l'itinéraire ou la durée d'arrêt, l'invariance de la politique n'est pas absolue. Un potentiel de distance négative doit utiliser la réduction initiale et des définitions de terminal/état cohérentes. L'exemple +2/+1/+2 de la figure utilise γ=1 et Φ terminal=0.
Figure 1 — Exemple avec γ = 1 et Φ terminal = 0. Pour γ quelconque, utilisez la somme finie actualisée ci-dessus.
4. Manipulation de la récompense : Obtenir un score conforme à la lettre, mais pas conforme à l’intention
La manipulation de la récompense, ou jeu de spécification, est un phénomène où un agent respecte strictement la lettre de la fonction de récompense tout en obtenant une récompense élevée par un comportement très éloigné de l’intention du concepteur.
Un exemple bien connu est l’expérience d’OpenAI entraînant un agent au jeu de course de bateaux CoastRunners. Ce jeu comportait une mécanique où toucher des cibles le long du parcours ajoutait du score. Les concepteurs ont défini la maximisation du score comme récompense. L'objectif était que l'agent termine la course tout en collectant des cibles, mais l'agent entraîné n'a pas progressé sur le parcours. Il est resté dans un coin du lagon, percutant sans cesse trois cibles qui réapparaissaient à cet endroit, incendiant son propre bateau et entrant en collision avec d'autres embarcations, tout en accumulant un score supérieur à celui d'un joueur humain moyen. Ce résultat est dû à la maximisation de l'« objectif écrit » (collision avec les cibles) plutôt que de l'« objectif visé » : terminer la course.
Ce type de phénomène survient souvent en exploitant une faille dans la fonction de récompense (un bug, un oubli ou un comportement propre au simulateur). Les contre-mesures pratiques consistent notamment à décomposer chaque terme de la récompense dans un journal afin de vérifier sur quel terme la politique entraînée marque des points, à formaliser l'intention sous une forme lisible par l'humain et à détecter tout écart par rapport à celle-ci, et à vérifier les performances finales dans un environnement d'évaluation indépendant de l'environnement d'entraînement. Modifier l'algorithme seul ne suffit généralement pas à résoudre le problème : la récompense et l'infrastructure d'audit associée sont au cœur de la solution.
5. Estimer à partir de démonstrations plutôt que de définir la récompense : l’apprentissage par renforcement inverse comme solution
Une solution à la difficulté de concevoir une récompense consiste simplement à éviter qu’un humain la définisse manuellement. L’apprentissage par renforcement inverse (IRL) part des données de démonstration (issues d’un humain ou d’un système existant) pour inférer une fonction de récompense expliquant ce comportement, puis optimise une politique en fonction de cette récompense.
Plus il est difficile de définir une récompense pertinente pour une tâche (par exemple, « poser la tasse sur l’étagère sans la faire tomber »), plus l’IRL est motivé à inférer l’objectif à partir de démonstrations. Cependant, comme expliqué dans Apprentissage par imitation et apprentissage par renforcement inverse, une récompense estimée par IRL n’est pas unique et son comportement dans des situations non présentes lors des démonstrations n’est pas garanti. La difficulté de définir une récompense manuellement et l’incertitude liée à une récompense estimée à partir de démonstrations sont les deux faces d’une même pièce, un compromis qui ne s’annule jamais. Quel que soit votre choix, il est toujours nécessaire de vérifier le comportement dans des situations inédites par une évaluation indépendante.
6. Ne pas tout regrouper dans une seule récompense : le cadre de l’apprentissage par renforcement contraint
Jusqu’à présent, nous avons supposé que chaque objectif (réalisation de la tâche, sécurité, efficacité énergétique, confort) était regroupé dans une seule récompense scalaire R(s,a,s') sous forme de somme pondérée.
Or, il est dangereux d’intégrer un objectif comme la sécurité — où « une seule violation peut être fatale » — dans la même somme pondérée que les autres objectifs. Quelle que soit l’importance accordée au terme de sécurité, il existe théoriquement toujours un cas où la récompense de la tâche est suffisamment élevée pour qu’une violation reste avantageuse. L’apprentissage par renforcement contraint (ou apprentissage par renforcement sécurisé) sépare la fonction objectif des contraintes.
Ici, C représente une fonction de coût (collision, écart, génération de dangers). force, etc.), et d représente la limite supérieure admissible. Ce système maximise la récompense tout en traitant la contrainte — selon laquelle le coût attendu ne doit pas dépasser un certain seuil — comme un élément distinct. Ceci remplace le problème de réglage qui hante les concepteurs de systèmes de récompense — « quel doit être le poids du terme de sécurité ? » — par un paramètre différent, et souvent plus interprétable : le seuil de la contrainte.
Au niveau de l'implémentation, comme évoqué dans Les Fondements de l'Apprentissage par Renforcement et Q-Learning et DQN, placer les contraintes de sécurité — une limite de vitesse, une limite souple d'angle articulaire, un arrêt d'urgence — en dehors du système d'apprentissage (dans un système de supervision) est également une application concrète de cette idée de « ne pas se fier à une seule récompense ». La formulation RL contrainte et la supervision de sécurité externe L'apprenant et l'apprenant comprennent tous deux, à différents niveaux, la même philosophie sous-jacente : « la sécurité ne doit pas reposer uniquement sur la pondération des récompenses ».
7. Liste de vérification pour la conception des récompenses
-
Avez-vous décomposé chaque terme de la récompense en un logarithme et vérifié individuellement sur quel terme la politique entraînée obtient un score ? Chaque terme d'une récompense dense représente-t-il raisonnablement l'objectif réel ?
-
Lors de l'ajout d'une récompense dense, avez-vous vérifié si elle peut être exprimée comme une différence potentielle ? Dans le cas contraire, pouvez-vous accepter le risque que la politique optimale change involontairement ?
-
Avez-vous examiné la récompense pour détecter d'éventuelles failles (bugs, comportements spécifiques au simulateur, conditions limites) avant l'entraînement ? Avez-vous évalué la politique entraînée par rapport à un critère indépendant de la récompense (semble-t-elle correcte pour un humain ? Réussit-elle la tâche réelle ?) ?
-
Pour les tâches où la conception d'une bonne récompense est complexe, avez-vous envisagé des alternatives comme l'apprentissage par renforcement intrinsèque (IRL) ou l'apprentissage par imitation ?
-
Intégrez-vous un objectif « qui ne doit jamais être enfreint », comme la sécurité, dans la même somme pondérée que la récompense de la tâche ? Pouvez-vous le séparer à l'aide d'une… Formulation RL contrainte ou supervision de la sécurité externe à l'apprenant ?
-
Avez-vous préparé des données d'évaluation, indépendantes de l'entraînement, dans des conditions différentes de l'environnement d'entraînement (état initial, perturbations, scénarios inédits) ?
Résumé
Dans les implémentations d'apprentissage par renforcement, la conception du système de récompenses prend souvent plus de temps que le choix de l'algorithme. Une récompense clairsemée est honnête mais l'apprentissage est lent ; une récompense dense accélère l'apprentissage mais risque de créer des raccourcis qui s'éloignent de l'intention. Le façonnage de la récompense basé sur le potentiel est l'un des rares moyens d'ajouter cette récompense dense avec la garantie qu'elle « ne modifiera pas la politique optimale ». Malgré cela, le détournement de la récompense existe bel et bien : comme le montrent des cas tels que CoastRunners, un agent peut maximiser la récompense écrite littéralement, mais d'une manière très éloignée de l'intention. L'apprentissage par renforcement inverse, qui infère la récompense à partir de démonstrations au lieu de la faire écrire par un humain, et le RL contraint, qui dissocie la sécurité de la pondération de la récompense, sont deux options issues d'une même leçon : ne pas tout miser sur une seule récompense.
Qu'est-ce qu'une récompense pour une arrivée rapide peut omettre ?
Elle peut omettre les collisions, les mouvements brusques ou la consommation d'énergie. Identifiez les failles et les contraintes qui doivent être respectées indépendamment de la récompense.
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.