#Sim-to-Real
Principes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robots
L'apprentissage par renforcement est un processus en boucle fermée où un agent choisit ses actions à partir d'observations et maximise les récompenses différées. Ce guide explique les processus de décision markoviens (MDP), les fonctions de valeur, les politiques, les équations de Bellman, l'exploration et l'exploitation, la conception des récompenses et le passage de la simulation à un robot réel.
Fundamentals · 8 min de lecture Apprentissage par renforcement September 3, 2026Apprentissage par renforcement basé sur un modèle et passage de la simulation au réel
Modèles du monde, erreur de prédiction, MPC, randomisation de domaine, identification de système et surveillance de la sécurité pour les machines réelles.
Fundamentals · 5 min de lectureGradient de politique, PPO et SAC — Contrôle continu stable pour les robots
Les gradients de politique mettent à jour directement une politique afin d'assurer la continuité de la direction, de la poussée et du couple articulaire. Cet article établit un lien entre Actor-Critic, PPO et SAC, puis aborde le clipping, la régularisation entropique, l'évaluation et la limite de sécurité pour le transfert de la simulation vers le réel.
Fundamentals · 7 min de lecture