Apprentissage par renforcement
September 4, 2026
Introduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi
Lorsque plusieurs agents apprennent simultanément, un processus de décision markovien (MDP) à agent unique n'est plus valable. Cet article présente, à l'aide d'équations et de diagrammes, la non-stationnarité, les contextes coopératifs, compétitifs et mixtes, l'algorithme CTDE, le problème d'attribution de crédit, ainsi que les algorithmes MADDPG et QMIX.
Fundamentals · 9 min de lecture