Contents — find the section you need
L'apprentissage par renforcement Q-learning et DQN choisissent parmi un ensemble d'actions fini. La vitesse d'une roue, la poussée d'un drone ou le couple d'un manipulateur sont cependant continus. Les méthodes de gradient de politique mettent à jour une politique \pi_\theta qui génère une distribution sur les actions continues. Actor-Critic ajoute un Critic qui évalue ces actions ; PPO et SAC ajoutent une stabilisation pratique largement utilisée en robotique.
Résumé en 30 secondes
-
Les gradients de politique augmentent directement le rendement espéré J(\theta). Ils gèrent naturellement les actions continues, mais les estimations pour une seule trajectoire présentent une variance élevée.
-
Actor-Critic utilise une estimation de valeur comme référence. L'avantage mesure si une action était meilleure que l'action moyenne dans le même état.
-
PPO limite le rapport de probabilité entre l'ancienne et la nouvelle politique afin qu'une mise à jour ne puisse pas trop s'éloigner de la politique initiale. C'est simple, mais les données de la politique initiale sont difficiles à réutiliser.
-
SAC maximise à la fois la récompense et l'entropie de la politique. Cette méthode, qui fonctionne hors stratégie, utilise la relecture et convient parfaitement au contrôle continu.
-
Aucune de ces méthodes ne définit de limites de sécurité. Il est recommandé de ne pas inclure dans l'apprentissage les limites d'action, les limitations de débit, les régulateurs PID/MPC de bas niveau et les arrêts d'urgence.
1. Optimisation directe d'une politique
Figure 1 — L'acteur propose une distribution continue et le critique évalue le rendement. Sur le matériel, l'action passe par un contrôleur de bas niveau vérifié plutôt que d'être appliquée directement au couple.
Pour une politique stochastique \pi_\theta(a\mid s) , le gradient du rendement espéré J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] peut être exprimé à l'aide du gradient de la logarithme de la probabilité :
Les actions ayant produit un rendement élevé deviennent plus probables. Comme G_t est bruité et retardé, la soustraction d'une valeur de référence dépendant de l'état b(s_t) réduit la variance sans modifier le rendement espéré. Gradient :
2. Avantage et modèle acteur-critique
Le critique apprend V_\phi(s) et estime si une action était meilleure que la moyenne de l'état avec A_t=Q(s_t,a_t)-V(s_t). Une approximation TD en une étape est :
L'estimation d'avantage généralisée (GAE) combine plusieurs étapes avec un hyperparamètre biais-variance \lambda. Lorsque \lambda tend vers 1, elle utilise un horizon plus long et un biais plus faible, mais une variance plus élevée. Pour une boucle d'attitude rapide, utilisez le délai et l'échelle de temps réels de la tâche plutôt que de copier une configuration de référence.
La perte de l'acteur est :
et le critique minimise l'erreur quadratique moyenne.
Lorsqu'un encodeur d'image est partagé, un gradient modifie les deux estimations. Des taux d'apprentissage distincts, un écrêtage du gradient et une valeur fixe sont utilisés. L'enregistrement de la normalisation des observations facilite le diagnostic des défaillances.
3. PPO : ne pas modifier la politique de manière trop radicale d'un coup
Les gradients de politique « on-policy » collectent un déploiement avec la politique actuelle. Le réutiliser pour un trop grand nombre de mises à jour éloigne la nouvelle politique de la distribution des données. Le PPO calcule un rapport de probabilité entre l'ancienne politique \pi_{\theta_{old}} et la nouvelle politique,
et maximise l'objectif écrêté
Les avantages positifs ne peuvent pas augmenter leur probabilité indéfiniment, et les avantages négatifs ne peuvent pas la diminuer indéfiniment. Une petite valeur de \epsilon est prudente ; une grande valeur permet des mises à jour plus audacieuses. L'écrêtage n'est pas une contrainte de sécurité, donc les limites articulaires, de vitesse et de force restent distinctes.
Une implémentation collecte un déploiement fixe, normalise l'avantage et entraîne plusieurs époques par mini-lots. Sauvegardez les anciennes probabilités logarithmiques, distinguez un délai d'attente d'un véritable état terminal et figez les statistiques de normalisation lors de l'évaluation. Sinon Deux exécutions avec les mêmes pondérations peuvent donner des résultats différents.
4. SAC : récompense et entropie
Soft Actor-Critic (SAC) ajoute l'entropie de politique \mathcal{H}(\pi) à la récompense future en tant qu'objectif :
Le terme d'entropie empêche des actions équivalentes de converger prématurément vers une seule, agissant comme une température \alpha qui maintient l'exploration active. SAC fonctionne hors stratégie et utilise une mémoire tampon de relecture, permettant ainsi la réutilisation de chaque transition réelle. Cela améliore l'efficacité de l'échantillonnage, mais la gestion des données obsolètes, l'échelle de récompense et le réglage de la température restent importants.
Pour une action continue, l'acteur calcule la moyenne \mu_\theta(s) et l'écart type \sigma_\theta(s) d'une gaussienne, puis les transforme en bornes à l'aide de la fonction tangente hyperbolique (tanh) ou d'une autre transformation. La logarithme de la probabilité nécessite la correction jacobienne de cette transformation. Les réseaux Twin Q et l'estimation Q plus petite réduisent la surestimation. Déterminez si le déploiement utilise… Moyenne déterministe ou prise en compte du bruit d'exploration.
5. Choix entre PPO et SAC
| Aspect | PPO | SAC |
|---|---|---|
| Données | Déploiements en temps réel | Relecture hors stratégie |
| Exploration | Distribution de la stratégie et bonus d'entropie | L'entropie fait partie de l'objectif |
| Efficacité d'échantillonnage | Faible à moyenne | Souvent plus élevée |
| Principaux bogues | Log-probabilité, indicateurs de terminal, écrêtage | Surestimation du Q, échelle de récompense, correction tanh |
| Configuration typique | Nombreux simulateurs parallèles | Couple continu et données matérielles rares |
Le PPO est souvent stable lorsque de nombreux environnements simulés peuvent s'exécuter en parallèle. Le SAC peut être intéressant lorsque chaque transition réelle est coûteuse. Aucune de ces méthodes ne modélise automatiquement le délai des capteurs, les zones mortes des moteurs ou la saturation des actionneurs.
6. Simulation-Réel : une frontière, pas un interrupteur
L'écart entre simulation et réalité provient de la masse et du frottement, du jeu, de l'exposition et du bruit des capteurs, du délai réseau, de la chute de tension de la batterie et du plancher. Matériaux et éclairage. La randomisation du domaine échantillonne ces paramètres afin que la politique ne surapprenne pas une valeur idéale. La plage de valeurs doit être mesurée à partir du matériel ; randomiser des mondes impossibles ne fait que compliquer l’apprentissage.
Un transfert par étapes est plus sûr : (1) simulation pure, (2) relecture des enregistrements réels des capteurs sans mouvement, (3) tests à faible consommation avec les roues levées, (4) vitesse et force limitées sur un sol dégagé, et (5) la tâche elle-même. Enregistrez l’action demandée séparément de celle que le limiteur de sécurité a effectivement autorisée. Le passage de la simulation au réel est une boucle itérative d’identification et d’évaluation, et non un simple bouton de déploiement.
7. Sécurité et évaluation
L’écrêtage PPO et l’entropie SAC n’empêchent pas les collisions. Des moniteurs indépendants doivent vérifier la vitesse, l’accélération, l’angle articulaire, la force de contact, la pression hydraulique, le courant et la température. En cas d’observation invalide, de valeur NaN, d’horodatage expiré ou de perte de communication, le moniteur doit ordonner un arrêt sécurisé. Placez-le dans un processus ou un microcontrôleur séparé lorsque le risque le justifie.
Outre la récompense, mesurez le succès, le taux de collision, Déviation maximale, distance d'arrêt, énergie, fluidité d'exécution, latence d'inférence et taux d'intervention du limiteur de sécurité. Un taux de réussite élevé avec des interventions fréquentes signifie que la politique dépend du limiteur. Répétez les exécutions avec plusieurs initialisations aléatoires et indiquez la variance et les cas les plus défavorables, et non seulement la moyenne.
Liste de vérification de l'implémentation
-
Tester les unités d'action, les limites, l'ordre tanh/clip et les corrections de log-probabilité.
-
Pour PPO, sauvegarder les anciennes log-probabilités, l'avantage et les indicateurs de terminal et de délai d'attente.
-
Pour SAC, surveiller la distribution des relectures, les valeurs Q jumelles, la température \alpha et l'échelle de récompense.
-
Associer le prétraitement, la normalisation, les initialisations, les pondérations et les paramètres d'environnement à l'identifiant de l'expérience.
-
Maintenir le PID/MPC de bas niveau, les limites de débit, le chien de garde et l'arrêt d'urgence indépendants de l'apprenant.
-
Définir les conditions d'arrêt pour les journaux passifs, la faible consommation et le fonctionnement normal avant chaque transition.
-
Enregistrer les succès, les collisions, les interventions du limiteur, la latence, l'énergie et la déviation maximale. Ensemble.
Résumé
Les gradients de politique optimisent directement une distribution d'actions continue. Actor-Critic utilise Advantage pour réduire la variance ; PPO écrête la mise à jour ; SAC utilise l'entropie et la relecture pour améliorer l'exploration et l'efficacité des données. Aucun de ces algorithmes ne résout à lui seul l'incertitude matérielle ou la sécurité. Un contrôleur de bas niveau vérifié, un moniteur indépendant, un transfert par étapes et une évaluation du pire cas font partie de l'algorithme lorsqu'une politique apprise quitte la simulation.
L'écrêtage PPO garantit-il un comportement sûr ?
Il modère l'objectif d'optimisation, et non les contraintes de sécurité physique. Évaluez séparément la stabilité de l'entraînement et la sécurité des actions.
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.