Artículos
Construir, probar y analizar la tecnología. Los experimentos, la implementación y la investigación explican por qué funciona.
7

#Reinforcement Learning

Aprendizaje por refuerzo September 4, 2026

Introducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.

Cuando varios agentes aprenden simultáneamente, un MDP de un solo agente deja de ser válido. Este artículo organiza la no estacionariedad, los entornos cooperativos/competitivos/mixtos, el CTDE, el problema de asignación de créditos, y MADDPG y QMIX, con ecuaciones y diagramas.

Fundamentals · 10 min de lectura
Aprendizaje por refuerzo September 4, 2026

Introducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.

En las implementaciones de aprendizaje por refuerzo, el diseño de la función de recompensa suele determinar el resultado más que el propio algoritmo. Este artículo aborda la relación entre recompensas dispersas y densas, la invariancia de la política en la configuración de recompensas basada en el potencial, casos reales de manipulación de recompensas, aprendizaje por refuerzo inverso y aprendizaje por refuerzo con restricciones.

Fundamentals · 10 min de lectura
Tendencias tecnológicas September 4, 2026

Tendencias tecnológicas en los modelos mundiales

Un "modelo del mundo" aprende la dinámica de un entorno y simula el futuro en su propia mente. Desde VAE+RNN de Ha y Schmidhuber, pasando por DreamerV3, Genie 3 y Sora, hasta la arquitectura JEPA impulsada por Yann LeCun, este artículo traza un mapa de la división entre los enfoques generativos y no generativos, y la barrera común de la coherencia física con la que se topan ambos.

Trends · 10 min de lectura
Aprendizaje por refuerzo September 3, 2026

Introducción al aprendizaje por refuerzo: aprendizaje por imitación y aprendizaje por refuerzo inverso.

La clonación de comportamiento, DAgger y el aprendizaje por refuerzo inverso utilizan demostraciones cuando resulta difícil programar las recompensas. Esta introducción abarca el cambio de covariables, la inferencia de recompensas, las conexiones VLA, la evaluación, la seguridad y la procedencia de los datos.

Fundamentals · 7 min de lectura
Aprendizaje por refuerzo September 3, 2026

Fundamentos del aprendizaje por refuerzo: Procesos de decisión de Markov, ecuaciones de Bellman y exploración para robots

El aprendizaje por refuerzo es un ciclo cerrado en el que un agente elige acciones a partir de observaciones y maximiza las recompensas diferidas. Esta introducción explica los procesos de decisión de Markov (MDP), las funciones de valor, las políticas, las ecuaciones de Bellman, la exploración frente a la explotación, el diseño de recompensas y el camino desde la simulación hasta un robot real.

Fundamentals · 8 min de lectura
Aprendizaje por refuerzo September 3, 2026

Aprendizaje por refuerzo basado en modelos y de simulación a la realidad.

Modelos del mundo, error de predicción, MPC, aleatorización de dominios, identificación de sistemas y monitorización de seguridad para máquinas reales.

Fundamentals · 5 min de lectura
Tendencias tecnológicas August 20, 2026

Tendencias tecnológicas en la navegación

Desde el flujo de trabajo clásico de mapas, mapas de costos y planificación de rutas, hasta enfoques integrales mediante aprendizaje por refuerzo, pasando por modelos fundamentales basados en modelos de visión-lenguaje. Un análisis del estado actual de la navegación autónoma de robots móviles.

Trends · 9 min de lectura