Articles
Construire, tester et examiner la technologie. L’expérimentation, la réalisation et la recherche expliquent son fonctionnement.
← Guide d’apprentissage

Apprentissage par renforcement — Guide d’apprentissage

Apprentissage par renforcement — Un parcours structuré en robotique, commande, agriculture en environnement contrôlé, énergie et électronique de puissance.

Un parcours structuré en robotique, commande, agriculture en environnement contrôlé, énergie et électronique de puissance.

  1. Fundamentals · 8 min de lecture

    Principes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robots

    L'apprentissage par renforcement est un processus en boucle fermée où un agent choisit ses actions à partir d'observations et maximise les récompenses différées. Ce guide explique les processus de décision markoviens (MDP), les fonctions de valeur, les politiques, les équations de Bellman, l'exploration et l'exploitation, la conception des récompenses et le passage de la simulation à un robot réel.

  2. Fundamentals · 7 min de lecture

    Q-Learning et DQN — De la table Q à l'apprentissage par renforcement profond

    L'apprentissage par renforcement (Q-learning) met à jour les valeurs des actions en fonction de l'optimalité de Bellman. Ce guide retrace le cheminement d'une table Q classique à un réseau de neurones profond (Deep Q Network), en expliquant la réutilisation de l'expérience, les réseaux cibles, la surestimation et le placement sûr dans une pile de robots.

  3. Fundamentals · 7 min de lecture

    Gradient de politique, PPO et SAC — Contrôle continu stable pour les robots

    Les gradients de politique mettent à jour directement une politique afin d'assurer la continuité de la direction, de la poussée et du couple articulaire. Cet article établit un lien entre Actor-Critic, PPO et SAC, puis aborde le clipping, la régularisation entropique, l'évaluation et la limite de sécurité pour le transfert de la simulation vers le réel.

  4. Fundamentals · 10 min de lecture

    Introduction à la conception des récompenses — Pourquoi « Que maximiser » est la partie la plus difficile de l'apprentissage par renforcement

    Dans les implémentations d'apprentissage par renforcement, la conception de la fonction de récompense détermine plus souvent le résultat que l'algorithme lui-même. Cet article aborde la question des récompenses éparses et denses, l'invariance de la politique de mise en forme des récompenses basée sur le potentiel, des cas concrets de manipulation des récompenses, l'apprentissage par renforcement inverse et l'apprentissage par renforcement contraint.

  5. Fundamentals · 5 min de lecture

    Apprentissage par renforcement basé sur un modèle et passage de la simulation au réel

    Modèles du monde, erreur de prédiction, MPC, randomisation de domaine, identification de système et surveillance de la sécurité pour les machines réelles.

  6. Fundamentals · 7 min de lecture

    Introduction à l'apprentissage par renforcement : apprentissage par imitation et apprentissage par renforcement inverse

    Le clonage comportemental, DAgger et l'apprentissage par renforcement inverse utilisent des démonstrations lorsque la programmation des récompenses est complexe. Ce guide aborde le décalage de covariables, l'inférence des récompenses, les connexions VLA, l'évaluation, la sécurité et la provenance des données.

  7. Fundamentals · 13 min de lecture

    π0 expliqué — Comment la correspondance des flux a changé la génération d'actions VLA

    Un guide technique basé sur les sources pour π0 de Physical Intelligence : le VLM PaliGemma et l'expert en actions dédié, la génération d'actions continues avec correspondance de flux conditionnelle, l'entraînement inter-incarnation sur sept types de robots et la différence avec les modèles VLA autorégressifs tels que RT-2 et OpenVLA.

  8. Fundamentals · 9 min de lecture

    Introduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi

    Lorsque plusieurs agents apprennent simultanément, un processus de décision markovien (MDP) à agent unique n'est plus valable. Cet article présente, à l'aide d'équations et de diagrammes, la non-stationnarité, les contextes coopératifs, compétitifs et mixtes, l'algorithme CTDE, le problème d'attribution de crédit, ainsi que les algorithmes MADDPG et QMIX.

Search this field →