Apprentissage par renforcement — Guide d’apprentissage
Apprentissage par renforcement — Un parcours structuré en robotique, commande, agriculture en environnement contrôlé, énergie et électronique de puissance.
Un parcours structuré en robotique, commande, agriculture en environnement contrôlé, énergie et électronique de puissance.
- Fundamentals · 8 min de lecture
Principes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robots
L'apprentissage par renforcement est un processus en boucle fermée où un agent choisit ses actions à partir d'observations et maximise les récompenses différées. Ce guide explique les processus de décision markoviens (MDP), les fonctions de valeur, les politiques, les équations de Bellman, l'exploration et l'exploitation, la conception des récompenses et le passage de la simulation à un robot réel.
- Fundamentals · 7 min de lecture
Q-Learning et DQN — De la table Q à l'apprentissage par renforcement profond
L'apprentissage par renforcement (Q-learning) met à jour les valeurs des actions en fonction de l'optimalité de Bellman. Ce guide retrace le cheminement d'une table Q classique à un réseau de neurones profond (Deep Q Network), en expliquant la réutilisation de l'expérience, les réseaux cibles, la surestimation et le placement sûr dans une pile de robots.
- Fundamentals · 7 min de lecture
Gradient de politique, PPO et SAC — Contrôle continu stable pour les robots
Les gradients de politique mettent à jour directement une politique afin d'assurer la continuité de la direction, de la poussée et du couple articulaire. Cet article établit un lien entre Actor-Critic, PPO et SAC, puis aborde le clipping, la régularisation entropique, l'évaluation et la limite de sécurité pour le transfert de la simulation vers le réel.
- Fundamentals · 10 min de lecture
Introduction à la conception des récompenses — Pourquoi « Que maximiser » est la partie la plus difficile de l'apprentissage par renforcement
Dans les implémentations d'apprentissage par renforcement, la conception de la fonction de récompense détermine plus souvent le résultat que l'algorithme lui-même. Cet article aborde la question des récompenses éparses et denses, l'invariance de la politique de mise en forme des récompenses basée sur le potentiel, des cas concrets de manipulation des récompenses, l'apprentissage par renforcement inverse et l'apprentissage par renforcement contraint.
- Fundamentals · 5 min de lecture
Apprentissage par renforcement basé sur un modèle et passage de la simulation au réel
Modèles du monde, erreur de prédiction, MPC, randomisation de domaine, identification de système et surveillance de la sécurité pour les machines réelles.
- Fundamentals · 7 min de lecture
Introduction à l'apprentissage par renforcement : apprentissage par imitation et apprentissage par renforcement inverse
Le clonage comportemental, DAgger et l'apprentissage par renforcement inverse utilisent des démonstrations lorsque la programmation des récompenses est complexe. Ce guide aborde le décalage de covariables, l'inférence des récompenses, les connexions VLA, l'évaluation, la sécurité et la provenance des données.
- Fundamentals · 13 min de lecture
π0 expliqué — Comment la correspondance des flux a changé la génération d'actions VLA
Un guide technique basé sur les sources pour π0 de Physical Intelligence : le VLM PaliGemma et l'expert en actions dédié, la génération d'actions continues avec correspondance de flux conditionnelle, l'entraînement inter-incarnation sur sept types de robots et la différence avec les modèles VLA autorégressifs tels que RT-2 et OpenVLA.
- Fundamentals · 9 min de lecture
Introduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi
Lorsque plusieurs agents apprennent simultanément, un processus de décision markovien (MDP) à agent unique n'est plus valable. Cet article présente, à l'aide d'équations et de diagrammes, la non-stationnarité, les contextes coopératifs, compétitifs et mixtes, l'algorithme CTDE, le problème d'attribution de crédit, ainsi que les algorithmes MADDPG et QMIX.