#Reinforcement Learning
Introducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.
Cuando varios agentes aprenden simultáneamente, un MDP de un solo agente deja de ser válido. Este artículo organiza la no estacionariedad, los entornos cooperativos/competitivos/mixtos, el CTDE, el problema de asignación de créditos, y MADDPG y QMIX, con ecuaciones y diagramas.
Fundamentals · 10 min de lecturaIntroducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.
En las implementaciones de aprendizaje por refuerzo, el diseño de la función de recompensa suele determinar el resultado más que el propio algoritmo. Este artículo aborda la relación entre recompensas dispersas y densas, la invariancia de la política en la configuración de recompensas basada en el potencial, casos reales de manipulación de recompensas, aprendizaje por refuerzo inverso y aprendizaje por refuerzo con restricciones.
Fundamentals · 10 min de lecturaTendencias tecnológicas en los modelos mundiales
Un "modelo del mundo" aprende la dinámica de un entorno y simula el futuro en su propia mente. Desde VAE+RNN de Ha y Schmidhuber, pasando por DreamerV3, Genie 3 y Sora, hasta la arquitectura JEPA impulsada por Yann LeCun, este artículo traza un mapa de la división entre los enfoques generativos y no generativos, y la barrera común de la coherencia física con la que se topan ambos.
Trends · 10 min de lecturaIntroducción al aprendizaje por refuerzo: aprendizaje por imitación y aprendizaje por refuerzo inverso.
La clonación de comportamiento, DAgger y el aprendizaje por refuerzo inverso utilizan demostraciones cuando resulta difícil programar las recompensas. Esta introducción abarca el cambio de covariables, la inferencia de recompensas, las conexiones VLA, la evaluación, la seguridad y la procedencia de los datos.
Fundamentals · 7 min de lectura Aprendizaje por refuerzo September 3, 2026Fundamentos del aprendizaje por refuerzo: Procesos de decisión de Markov, ecuaciones de Bellman y exploración para robots
El aprendizaje por refuerzo es un ciclo cerrado en el que un agente elige acciones a partir de observaciones y maximiza las recompensas diferidas. Esta introducción explica los procesos de decisión de Markov (MDP), las funciones de valor, las políticas, las ecuaciones de Bellman, la exploración frente a la explotación, el diseño de recompensas y el camino desde la simulación hasta un robot real.
Fundamentals · 8 min de lectura Aprendizaje por refuerzo September 3, 2026Aprendizaje por refuerzo basado en modelos y de simulación a la realidad.
Modelos del mundo, error de predicción, MPC, aleatorización de dominios, identificación de sistemas y monitorización de seguridad para máquinas reales.
Fundamentals · 5 min de lecturaTendencias tecnológicas en la navegación
Desde el flujo de trabajo clásico de mapas, mapas de costos y planificación de rutas, hasta enfoques integrales mediante aprendizaje por refuerzo, pasando por modelos fundamentales basados en modelos de visión-lenguaje. Un análisis del estado actual de la navegación autónoma de robots móviles.
Trends · 9 min de lectura