Aprendizaje por refuerzo
September 4, 2026
Introducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.
Cuando varios agentes aprenden simultáneamente, un MDP de un solo agente deja de ser válido. Este artículo organiza la no estacionariedad, los entornos cooperativos/competitivos/mixtos, el CTDE, el problema de asignación de créditos, y MADDPG y QMIX, con ecuaciones y diagramas.
Fundamentals · 10 min de lectura