Apprentissage par renforcement
September 3, 2026
Gradient de politique, PPO et SAC — Contrôle continu stable pour les robots
Les gradients de politique mettent à jour directement une politique afin d'assurer la continuité de la direction, de la poussée et du couple articulaire. Cet article établit un lien entre Actor-Critic, PPO et SAC, puis aborde le clipping, la régularisation entropique, l'évaluation et la limite de sécurité pour le transfert de la simulation vers le réel.
Fundamentals · 7 min de lecture