Contents — find the section you need
Conclusion
L'apprentissage par renforcement basé sur un modèle (MBRL) apprend un modèle du monde \hat f, qui associe un état et une action à un état suivant prédit, teste les séquences d'actions à l'intérieur de ce modèle et n'applique au matériel que les actions supervisées. Les méthodes sans modèle apprennent une politique directement à partir de la récompense ; le MBRL peut être plus économe en données et peut exprimer des contraintes, mais les erreurs de modélisation peuvent entraîner des succès uniquement sur simulateur. Voir Principes de base du RL, Q-learning, PPO/SAC et MPC.
Modèles et planification du monde
Figure 1 — SVG conceptuel créé par Duskcoil, données système non mesurées.
Apprentissage de \hat s_{t+1}=\hat f_\theta(s_t,a_t) et optimisation d'un objectif à horizon glissant :
Simulation-Réel, identification et sécurité
Les erreurs ponctuelles s'accumulent lors de déploiements prolongés. Les ensembles permettent d'estimer l'incertitude ; les planificateurs peuvent ainsi éviter les zones de forte variance et utiliser des horizons courts. La randomisation du domaine fait varier la masse, le frottement, le délai, le bruit des capteurs, l'éclairage et la pose de la caméra. L'identification du système mesure l'inertie, le frottement, les constantes du moteur et la latence afin que ces plages de valeurs soient justifiées et non arbitraires.
Passez de l'enregistrement des données au contrôle d'ombre à basse vitesse, puis aux essais supervisés limités. Excluez de la politique apprise l'arrêt d'urgence, les moniteurs indépendants de vitesse/force/température, l'arrêt en cas de perte de communication et la séparation humaine. Les défaillances courantes incluent les simulations à frottement fixe provoquant le patinage des roues, le surapprentissage de l'éclairage, la manipulation des récompenses générant des vibrations et les délais non modélisés causant une instabilité. Signalez le nombre de violations, la distance d'arrêt, l'abstention déclenchée par l'incertitude et… Comportement dans le pire des cas – pas seulement une récompense moyenne.
Rôles des approches sans modèle et avec modèle
L'apprentissage par renforcement sans modèle (RL sans modèle) met à jour une politique ou une valeur directement à partir de l'expérience. Il est expressif lorsque la dynamique des contacts est difficile à modéliser, mais chaque amélioration peut nécessiter des essais réels. L'apprentissage par renforcement avec modèle (MBRL) réutilise chaque transition pour entraîner un prédicteur et évalue de nombreuses séquences candidates dans ce prédicteur. Si le prédicteur présente un biais systématique, le planificateur optimise un raccourci réservé au simulateur.
| Aspect | Sans modèle | Avec modèle |
|---|---|---|
| Données matérielles | Efficacité faible à moyenne | Efficacité moyenne à élevée dans la plage du modèle |
| Temps d'exécution | Inférence de politique souvent légère | Déploiements et optimisation à chaque cycle |
| Contraintes | Généralement une couche de récompense/sécurité indirecte | Naturellement intégrées au problème de planification |
| Principal échec | Mauvaise extrapolation à partir de données éparses | Erreur de modèle à long terme |
| Ajustement typique | Politiques de contact et visuelles complexes | Planification des mouvements, de l'énergie et de la température à court terme |
Les piles hybrides sont En général : une politique apprise propose des candidats, un modèle appris prédit un horizon court et le MPC impose des contraintes de vitesse, de force et de courant. Utilisez l’article PPO/SAC et l’article MPC pour attribuer les responsabilités en matière de synchronisation et de sécurité, plutôt que de considérer les algorithmes comme des solutions de remplacement.
Ne pas réduire l’incertitude à un seul nombre
L’incertitude épistémique provient de données d’entraînement manquantes ; l’incertitude aléatoire provient de la variation irréductible des capteurs et de l’environnement. La variance d’ensemble est un signal utile pour la première, mais un ensemble peut néanmoins partager le même biais. Lorsque la variance prédictive dépasse un seuil, raccourcissez l’horizon, réduisez la vitesse, passez à un contrôleur classique ou effectuez une autre observation avant la planification. Cette politique d’abstention doit être spécifiée avant le déploiement.
Pour le résidu à une étape e_t=s_{t+1}-\hat s_{t+1}, utilisez les quantiles logarithmiques et les pires cas en plus de l’erreur quadratique moyenne. Une moyenne faible Une erreur peut masquer une erreur importante juste avant le contact. Ne jamais interpréter un intervalle de prédiction probabiliste comme une garantie de sécurité ; utiliser des systèmes de surveillance indépendants des collisions, de la force, de la température et du courant.
Conception d'expériences d'identification
L'identification d'un système est un problème de conception expérimentale, et non un simple étalonnage. Pour un moteur, mesurez séparément le frottement statique, l'inertie à différentes vitesses, le couple dépendant de la charge et le délai aller-retour de la communication. Pour un actionneur hydraulique, horodatez la pression, le débit, la vitesse du vérin, la température de l'huile et la commande de la vanne sur une même horloge. Segmentez les données par jour, étage, charge utile, éclairage et température (et non par trames voisines aléatoires) afin que l'ensemble final soit véritablement inédit.
Une petite intuition numérique
Considérons un chariot de 1 kg dont la vitesse varie de 0.1u toutes les T_s=0.1\,\mathrm{s}. Un modèle sans frottement prédit une augmentation de vitesse de 0.5\,\mathrm{m/s} pendant u=1 étapes sur cinq. Si le chariot réel perd 0.02\,\mathrm{m/s} par étape, En cas de friction, l'erreur à cinq étapes atteint 0.1\,\mathrm{m/s}. Un horizon plus court, l'identification en ligne, une marge sur la contrainte de vitesse et une replanification à partir des mesures permettent de maintenir l'utilité de ce modèle simple.
Preuves à publier
Conservez, en plus des équations, la période d'entraînement, la fréquence du capteur, le délai, la graine aléatoire, les paramètres d'environnement, la date limite du solveur et la politique de repli. Représentez graphiquement les résidus de prédiction, les violations de contraintes, la distance d'arrêt et l'abstention déclenchée par l'incertitude, en utilisant le même identifiant d'expérience que la récompense. Si les journaux bruts ne peuvent être partagés, publiez des statistiques anonymisées, les paramètres de simulation, les unités et une date de référence afin que la portée de l'affirmation reste vérifiable.
Un modèle appris garantit-il des déploiements longs et fiables ?
Les petites erreurs du modèle s'accumulent au fil des prédictions. Vérifiez la longueur du déploiement, les états inconnus et la validation en conditions réelles.
Environnement.Références
Types de modèles du monde et planificateurs
Les modèles physiques sont interprétables, mais peuvent rencontrer des difficultés avec les contacts ; les modèles latents et d'ensemble peuvent être efficaces, mais nécessitent une validation par rapport à la sécurité en espace réel. Les actions candidates peuvent utiliser le tir, le CEM ou le MPC différentiable, avec une solution de repli en cas de délai.
Hygiène des données
Signalez les capteurs saturés, les erreurs temporelles, les interventions des limiteurs, les valeurs interpolées et les causes terminales. Maintenez l'ensemble d'évaluation immuable afin qu'une mise à jour du modèle ne puisse pas masquer une régression.
Limites des preuves
La précision de la prédiction, la récompense et le comportement sûr du matériel sont des affirmations distinctes. Publiez la métrique, la condition de test et la couche de sécurité responsable pour chacune.
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.