Aprendizaje automático
Aprendizaje automático — Una ruta estructurada de robótica, control, agricultura en entornos controlados, energía y electrónica de potencia.
Find a reading order in the learning guides → Search this field →
Todas las áreas
Evaluación comparativa de LLM locales: primera respuesta, tasa de generación y memoria.
Mida el contenido de la primera respuesta por separado de la tasa de generación y el control. residency, caching and memory conditions.
Hands-on · 3 min de lectura
Aprendizaje automático
September 5, 2026
Introducción a la detección de objetos y la segmentación semántica: Cómo interpretar "Qué hay dónde" a partir de una imagen.
La detección de objetos dibuja recuadros alrededor de los elementos; la segmentación semántica colorea cada píxel según su significado. Desde la diferencia entre ambas, pasando por la segmentación de instancias y la panóptica, hasta la evolución de R-CNN a YOLO, DETR y DINO, y sus contrapartes en nubes de puntos 3D, se ofrece un recorrido sistemático por los fundamentos de la comprensión de escenas.
Fundamentals · 18 min de lecturaIntroducción al aprendizaje automático: Modelos generativos
Los modelos generativos representan distribuciones de datos y crean resultados condicionales. Aprenda sobre probabilidad, VAE, GAN, difusión, evaluación, procedencia y seguridad.
Fundamentals · 6 min de lectura Aprendizaje automático September 4, 2026Introducción al aprendizaje automático: Fundamentos — Diseño de datos, pérdida y generalización
El aprendizaje automático no se limita a la selección de modelos: implica definir la tarea, la división de datos, la función de pérdida, la evaluación y los cambios en la implementación.
Fundamentals · 6 min de lectura Aprendizaje automático September 4, 2026Una guía completa de SegFormer: por qué un transformador sin codificación posicional funciona para la segmentación.
Este artículo analiza en detalle SegFormer, presentado por NVIDIA, la Universidad de Hong Kong y colaboradores en NeurIPS 2021, basándose en el artículo original. Examinamos el codificador jerárquico MiT sin codificación posicional, el decodificador All-MLP de parámetros eficientes, el campo receptivo efectivo y el mIoU medido, el recuento de parámetros y los cálculos desde B0 hasta B5 mediante ecuaciones.
Fundamentals · 11 min de lectura Aprendizaje automático September 4, 2026Explicación detallada de YOLO11: ¿Qué cambios introdujeron C3k2 y C2PSA con respecto a YOLOv8?
Analice en detalle Ultralytics YOLO11 utilizando documentación oficial y fuentes primarias: C3k2, C2PSA, detección sin anclaje, pérdidas DFL/CIoU y puntos de referencia medidos para n/s/m/l/x.
Fundamentals · 13 min de lectura Aprendizaje automático September 4, 2026Introducción al aprendizaje automático: Conceptos básicos de redes neuronales
Las redes neuronales combinan transformaciones afines y activaciones no lineales, y luego reducen la pérdida mediante retropropagación y optimización basada en gradientes.
Fundamentals · 6 min de lectura Aprendizaje automático September 4, 2026Introducción al aprendizaje automático: Estimación de la pose
La estimación de pose infiere puntos clave de personas u objetos y pose 6D a partir de imágenes. Esta introducción abarca coordenadas, pérdidas, oclusión, evaluación y seguridad.
Fundamentals · 6 min de lecturaIntroducción al aprendizaje por refuerzo multiagente: Optimización en un mundo donde el otro bando también está aprendiendo.
Cuando varios agentes aprenden simultáneamente, un MDP de un solo agente deja de ser válido. Este artículo organiza la no estacionariedad, los entornos cooperativos/competitivos/mixtos, el CTDE, el problema de asignación de créditos, y MADDPG y QMIX, con ecuaciones y diagramas.
Fundamentals · 10 min de lectura Aprendizaje por refuerzo September 4, 2026Explicación de π0: cómo la coincidencia de flujo cambió la generación de acciones de VLA
Una guía técnica basada en fuentes para el π0 de Physical Intelligence: el VLM PaliGemma y el Action Expert dedicado, la generación continua de acciones con coincidencia de flujo condicional, el entrenamiento entre diferentes tipos de robots y la diferencia con los modelos VLA autorregresivos como RT-2 y OpenVLA.
Fundamentals · 13 min de lecturaIntroducción al diseño de recompensas: por qué "qué maximizar" es la parte más difícil del aprendizaje por refuerzo.
En las implementaciones de aprendizaje por refuerzo, el diseño de la función de recompensa suele determinar el resultado más que el propio algoritmo. Este artículo aborda la relación entre recompensas dispersas y densas, la invariancia de la política en la configuración de recompensas basada en el potencial, casos reales de manipulación de recompensas, aprendizaje por refuerzo inverso y aprendizaje por refuerzo con restricciones.
Fundamentals · 10 min de lecturaIntroducción al aprendizaje por refuerzo: aprendizaje por imitación y aprendizaje por refuerzo inverso.
La clonación de comportamiento, DAgger y el aprendizaje por refuerzo inverso utilizan demostraciones cuando resulta difícil programar las recompensas. Esta introducción abarca el cambio de covariables, la inferencia de recompensas, las conexiones VLA, la evaluación, la seguridad y la procedencia de los datos.
Fundamentals · 7 min de lectura Aprendizaje por refuerzo September 3, 2026Fundamentos del aprendizaje por refuerzo: Procesos de decisión de Markov, ecuaciones de Bellman y exploración para robots
El aprendizaje por refuerzo es un ciclo cerrado en el que un agente elige acciones a partir de observaciones y maximiza las recompensas diferidas. Esta introducción explica los procesos de decisión de Markov (MDP), las funciones de valor, las políticas, las ecuaciones de Bellman, la exploración frente a la explotación, el diseño de recompensas y el camino desde la simulación hasta un robot real.
Fundamentals · 8 min de lectura Aprendizaje por refuerzo September 3, 2026Aprendizaje por refuerzo basado en modelos y de simulación a la realidad.
Modelos del mundo, error de predicción, MPC, aleatorización de dominios, identificación de sistemas y monitorización de seguridad para máquinas reales.
Fundamentals · 5 min de lecturaGradientes de política, PPO y SAC: control continuo estable para robots
Los gradientes de política actualizan directamente una política para que la dirección, el empuje y el par articular se mantengan continuos. Este artículo relaciona Actor-Crítico, PPO y SAC, y luego aborda el recorte, la regularización de entropía, la evaluación y el límite de seguridad para la transferencia de simulación a la realidad.
Fundamentals · 7 min de lecturaAprendizaje Q y DQN: De la tabla Q al aprendizaje profundo por refuerzo.
El aprendizaje Q actualiza los valores de acción con el objetivo de optimalidad de Bellman. Esta introducción recorre el camino desde una tabla Q tabular hasta una red Q profunda, explicando la reproducción de experiencias, las redes objetivo, la sobreestimación y la ubicación segura en una pila de robots.
Fundamentals · 7 min de lectura