Apprendimento per rinforzo
September 4, 2026
Introduzione all'apprendimento per rinforzo multi-agente: ottimizzazione in un mondo in cui anche l'altra parte sta imparando.
Quando più agenti apprendono contemporaneamente, un MDP a singolo agente non è più valido. Questo articolo organizza, con equazioni e diagrammi, i concetti di non stazionarietà, contesti cooperativi/competitivi/misti, CTDE, il problema dell'assegnazione del credito, MADDPG e QMIX.
Fundamentals · 9 min di lettura