Artículos
Construir, probar y analizar la tecnología. Los experimentos, la implementación y la investigación explican por qué funciona.
← Guía de aprendizaje

Aprendizaje por refuerzo — Guía de aprendizaje

Aprendizaje por refuerzo — Una ruta estructurada de robótica, control, agricultura en entornos controlados, energía y electrónica de potencia.

Una ruta estructurada de robótica, control, agricultura en entornos controlados, energía y electrónica de potencia.

  1. Fundamentals · 8 min de lectura

    Fundamentos del aprendizaje por refuerzo: Procesos de decisión de Markov, ecuaciones de Bellman y exploración para robots

    El aprendizaje por refuerzo es un ciclo cerrado en el que un agente elige acciones a partir de observaciones y maximiza las recompensas diferidas. Esta introducción explica los procesos de decisión de Markov (MDP), las funciones de valor, las políticas, las ecuaciones de Bellman, la exploración frente a la explotación, el diseño de recompensas y el camino desde la simulación hasta un robot real.

  2. Fundamentals · 7 min de lectura

    Aprendizaje Q y DQN: De la tabla Q al aprendizaje profundo por refuerzo.

    El aprendizaje Q actualiza los valores de acción con el objetivo de optimalidad de Bellman. Esta introducción recorre el camino desde una tabla Q tabular hasta una red Q profunda, explicando la reproducción de experiencias, las redes objetivo, la sobreestimación y la ubicación segura en una pila de robots.

  3. Fundamentals · 7 min de lectura

    Gradientes de política, PPO y SAC: control continuo estable para robots

    Los gradientes de política actualizan directamente una política para que la dirección, el empuje y el par articular se mantengan continuos. Este artículo relaciona Actor-Crítico, PPO y SAC, y luego aborda el recorte, la regularización de entropía, la evaluación y el límite de seguridad para la transferencia de simulación a la realidad.

  4. Fundamentals · 10 min de lectura

    Introducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.

    En las implementaciones de aprendizaje por refuerzo, el diseño de la función de recompensa suele determinar el resultado más que el propio algoritmo. Este artículo aborda la relación entre recompensas dispersas y densas, la invariancia de la política en la configuración de recompensas basada en el potencial, casos reales de manipulación de recompensas, aprendizaje por refuerzo inverso y aprendizaje por refuerzo con restricciones.

  5. Fundamentals · 5 min de lectura

    Aprendizaje por refuerzo basado en modelos y de simulación a la realidad.

    Modelos del mundo, error de predicción, MPC, aleatorización de dominios, identificación de sistemas y monitorización de seguridad para máquinas reales.

  6. Fundamentals · 7 min de lectura

    Introducción al aprendizaje por refuerzo: aprendizaje por imitación y aprendizaje por refuerzo inverso.

    La clonación de comportamiento, DAgger y el aprendizaje por refuerzo inverso utilizan demostraciones cuando resulta difícil programar las recompensas. Esta introducción abarca el cambio de covariables, la inferencia de recompensas, las conexiones VLA, la evaluación, la seguridad y la procedencia de los datos.

  7. Fundamentals · 13 min de lectura

    Explicación de π0: cómo la coincidencia de flujo cambió la generación de acciones de VLA

    Una guía técnica basada en fuentes para el π0 de Physical Intelligence: el VLM PaliGemma y el Action Expert dedicado, la generación continua de acciones con coincidencia de flujo condicional, el entrenamiento entre diferentes tipos de robots y la diferencia con los modelos VLA autorregresivos como RT-2 y OpenVLA.

  8. Fundamentals · 10 min de lectura

    Introducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.

    Cuando varios agentes aprenden simultáneamente, un MDP de un solo agente deja de ser válido. Este artículo organiza la no estacionariedad, los entornos cooperativos/competitivos/mixtos, el CTDE, el problema de asignación de créditos, y MADDPG y QMIX, con ecuaciones y diagramas.

Search this field →