Contents — find the section you need
La familia YOLO se ha mantenido como uno de los enfoques más utilizados para la detección práctica de objetos, y su desarrollo ha continuado desde YOLOv8 en 2023. Publicado por Ultralytics el 10 de septiembre de 2024, YOLO11 conserva la misma estructura de “base → cuello → cabeza” que YOLOv8, aunque rediseña los bloques internos. Este artículo verifica los cambios y las características que conserva YOLO11, utilizando información primaria de la documentación oficial y los archivos YAML de definición del modelo, con ecuaciones y diagramas.
Este artículo se basa en la documentación oficial de Ultralytics (docs.ultralytics.com), los archivos de configuración del repositorio oficial de GitHub y la preimpresión «YOLOv11 Demystified» (arXiv:2604.03349).
0. Lo que aprenderá
- Los cambios específicos de YOLO11 con respecto a YOLOv8, incluyendo C3k2 y C2PSA
- Cómo el cabezal de detección sin anclaje predice las coordenadas, incluyendo DFL
- Las funciones de pérdida y los métodos de aumento utilizados para el entrenamiento
- Cómo varían la precisión, el número de parámetros y la velocidad en los cinco tamaños n/s/m/l/x, utilizando mediciones oficiales
- Cuándo elegir YOLO11 y cuándo considerar otra opción
1. ¿Qué es YOLO11?
YOLO11 es una generación de modelos de detección de objetos en tiempo real desarrollados y publicados por Ultralytics. Conserva el diseño de tres etapas de YOLOv8 (estructura principal, cuello y cabeza), reemplaza sus bloques de extracción de características con el nuevo C3k2 y añade el bloque de atención espacial C2PSA al final de la estructura principal. La misma arquitectura general abarca detección, segmentación, estimación de pose, clasificación, cajas delimitadoras orientadas (OBB) y seguimiento dentro de un mismo marco.
2. ¿Por qué era necesario este rediseño?
En aquel momento, YOLOv8 se utilizaba ampliamente como detector de una sola etapa con un excelente equilibrio entre precisión y velocidad, pero aún presentaba dos áreas de mejora. La primera era la eficiencia de los parámetros. Si se logra la misma precisión con menos parámetros y operaciones de punto flotante (FLOPs), su implementación en dispositivos periféricos y robots alimentados por batería resulta más práctica. La segunda era la falta de un mecanismo explícito para aprender dónde enfocar el enfoque en un mapa de características. La estructura principal de YOLOv8 construye características mediante convoluciones, pero carece de un mecanismo específico para separar las regiones importantes del fondo. C3k2 y C2PSA abordan estos dos problemas respectivamente.
3. ¿Cuál es la entrada?
Al igual que muchos otros detectores YOLO, YOLO11 toma una imagen RGB redimensionada y rellena de un tamaño fijo (640 × 640 píxeles por defecto). Tanto durante el entrenamiento como durante la inferencia, la entrada se procesa como un tensor [B, 3, H, W] por lotes. No se requiere ningún preprocesamiento especial, como normalización propietaria o división de parches: las imágenes, tras las operaciones de aumento estándar como Mosaic, se pasan directamente a la red neuronal.
4. ¿Qué predice?
Para cada objeto en la imagen, la salida contiene una clase, las coordenadas del cuadro delimitador y una puntuación de confianza. YOLO11 utiliza una cabeza desacoplada que separa las ramas de clasificación y regresión de cuadros. Además, no requiere anclajes, por lo que realiza la regresión de coordenadas directamente sin cuadros de anclaje predefinidos. La idea de predecir la distancia desde cada punto de la cuadrícula hasta el límite del objeto conecta a YOLO11 con la familia FCOS de detectores sin anclaje. Eliminar las cajas predefinidas para diversas relaciones de aspecto y escalas reduce el ajuste de hiperparámetros y puede mejorar la generalización a objetos con relaciones de aspecto extremas.
5. Arquitectura básica
Al igual que YOLOv8, YOLO11 sigue la estructura de tres etapas «columna vertebral → cuello → cabeza». El cambio radica en el contenido de dichas etapas.
Figura 1: Estructura principal, cuello y cabeza de YOLOv11. Los recuadros azules resaltados representan las partes modificadas con respecto a YOLOv8. C3k2 reemplaza el bloque básico tanto en la estructura principal como en el cuello, mientras que C2PSA se agrega al final de la estructura principal, inmediatamente después de SPPF.
La estructura principal genera mapas de características en tres resoluciones: P3, P4 y P5. El cuello (PAN-FPN: Red de Agregación de Rutas + Red Piramidal de Características) fusiona características de alta y baja resolución en ambas direcciones, lo que permite que la misma red detecte objetos pequeños y grandes. Este esqueleto de fusión multiescala permanece sin cambios con respecto a YOLOv8. Lo que cambió fue que C2f fue reemplazado por C3k2 como bloque básico, y C2PSA se insertó en la salida de la red troncal.
6. Detalles técnicos de los componentes
C3k2: una generalización de C2f
YOLOv8 utilizaba el bloque C2f, que tiene una estructura CSP (Cross Stage Partial), como su unidad básica. C2f divide los canales de entrada en dos rutas, envía una a través de varios bloques Bottleneck, deja la otra como atajo y luego concatena ambas salidas y las salidas intermedias de cada Bottleneck antes de fusionarlas con una convolución de 1 × 1.
YOLO11 mantiene la idea de repetir bloques internos, pero hace que el tipo de bloque interno sea configurable. En la definición oficial del modelo (YAML), cada bloque dentro de C3k2 puede ser uno de los siguientes, según los parámetros del constructor:
- Un bloque
Bottlenecknormal (utilizado por el modelo pequeño n) - Un bloque
C3k(una estructura C3 con tamaño de kernel configurable, utilizada conc3k=Trueen los modelos medianos y grandes m/l/x) - Un par
Bottleneck + PSABlock(utilizado dentro de C2PSA al final de la estructura principal)
En otras palabras, C3k2 es un bloque generalizado: conserva la idea de C2f, pero permite que sus cuellos de botella internos varíen desde bloques ligeros hasta bloques con mecanismos de atención, según el tamaño y la ubicación del modelo. Un detalle de implementación es que una configuración YAML cubre los cinco tamaños (n/s/m/l/x) mediante el intercambio de estos componentes internos.
C2PSA: agregando atención espacial a la red principal
C2PSA (Cross Stage Partial with Spatial Attention) es un nuevo bloque de YOLOv8 insertado inmediatamente después de SPPF (Spatial Pyramid Pooling - Fast, un módulo que expande el campo receptivo con múltiples tamaños de pooling). C2PSA también sigue una estructura CSP: una ruta pasa por varios PSABlocks. Cada PSABlock combina autoatención multi-cabeza (MHSA) y una red de alimentación directa de dos capas (FFN), conectadas mediante rutas residuales.
Aquí, x es la característica de entrada, \text{MHSA} es la autoatención multi-cabeza y \text{FFN} es la red de alimentación directa de dos capas. En comparación con la red principal de YOLOv8, que solo utiliza convoluciones, C2PSA emplea la autoatención para aprender directamente las relaciones entre posiciones distantes en un mapa de características. Complementa el campo receptivo local de la convolución y ayuda a concentrar el peso en las regiones importantes de la imagen.
Cabezal de detección sin anclaje y DFL
El cabezal de detección de YOLO11 separa la clasificación y la regresión de cajas en ramas desacopladas. No utiliza cajas de anclaje predefinidas; en cambio, cada punto de la cuadrícula en el mapa de características predice directamente la distancia al borde del objeto. Para cada una de las cuatro direcciones, la rama de regresión de cajas genera una distribución de probabilidad sobre \text{reg\_max}=16 intervalos discretos y utiliza su valor esperado como distancia continua. Esta es la idea detrás de la Pérdida Focal de Distribución (DFL), heredada de YOLOv8 y propuesta por Li et al. en "Pérdida Focal Generalizada" (NeurIPS 2020).
En lugar de realizar una regresión directa de un único valor real para la distancia a un borde, el modelo aprende una distribución discreta sobre intervalos probables. Esto hace que el entrenamiento sea más estable, a la vez que permite que la distribución exprese la incertidumbre para objetos con contornos ambiguos u ocluidos. YOLO11 también modifica la rama de clasificación para usar convolución separable en profundidad, lo que reduce el número de parámetros y el cálculo en comparación con la convolución convencional.
Funciones de pérdida y método de entrenamiento
La pérdida de entrenamiento de YOLO11 es una suma ponderada de la pérdida CIoU (IoU completa) para la regresión de cajas, la pérdida DFL para la distribución de coordenadas y la pérdida BCE (entropía cruzada binaria) para la clasificación.
La pérdida CIoU evalúa no solo el IoU (índice de superposición), sino también la distancia entre los centros de las cajas y la similitud de sus relaciones de aspecto.
\rho(b, b^{gt}) representa la distancia euclidiana entre los centros de las cajas predichas y reales; c es la longitud de la diagonal del rectángulo más pequeño que encierra ambas cajas; v representa la discrepancia en la relación de aspecto; y \alpha es un coeficiente que otorga mayor peso a v a medida que IoU aumenta. La optimización de IoU por sí sola prácticamente no proporciona gradiente cuando las cajas no se superponen; los términos de distancia entre centros y relación de aspecto mitigan este problema.
El entrenamiento utiliza técnicas de aumento como Mosaic, que combina varias imágenes; MixUp, que fusiona dos imágenes; Copy-Paste, que inserta una región de un objeto en otra imagen; RandAugment, que selecciona automáticamente transformaciones aleatorias; y Erasing, que elimina una región rectangular aleatoria. Estos detalles se describen en “YOLOv11 Desmitificado” (arXiv:2604.03349).
7. Comparación de variantes del modelo
YOLO11 está disponible en cinco tamaños con diferentes cantidades de parámetros y requisitos de cómputo: n (nano), s (pequeño), m (mediano), l (grande) y x (extragrande). A continuación se muestran los valores de referencia reportados en la documentación oficial de Ultralytics sobre COCO val2017 con una entrada de 640 píxeles.
| Modelo | mAP50-95 | Parámetros | FLOPs | Inferencia ONNX de CPU | Inferencia TensorRT de T4 |
|---|---|---|---|---|---|
| YOLO11n | 39.5 | 2.6M | 6.5B | 56.1 ± 0.8 ms | 1.5 ± 0.0 ms |
| YOLO11s | 47.0 | 9.4M | 21.6B | 90.0 ± 1.2 ms | 2.5 ± 0.0 ms |
| YOLO11m | 51.5 | 20.1M | 68.1B | 183.2 ± 2.0 ms | 4.7 ± 0.1 ms |
| YOLO11l | 53.4 | 25.3M | 87.2B | 238.6 ± 1.4 ms | 6.2 ± 0.1 ms |
| YOLO11x | 54.7 | 56.9M | 195.3B | 462.8 ± 6.7 ms | 11.3 ± 0.2 ms |
Fuente: Documentación oficial de Ultralytics YOLO11. La inferencia ONNX en CPU utiliza ONNX Runtime; la inferencia TensorRT en T4 es FP16 en una GPU NVIDIA T4.
Dos aspectos prácticos destacan. Primero, el número de parámetros aumenta aproximadamente 22 veces de n a x, mientras que el mAP50-95 solo sube unos 15 puntos, de 39,5 a 54,7: la precisión y el tamaño del modelo no están relacionados linealmente. Segundo, consideremos la diferencia entre m y l. Los parámetros aumentan solo de 20,1 millones a 25,3 millones, mientras que el mAP aumenta de 51,5 a 53,4 y el tiempo de inferencia en GPU de 4,7 ms a 6,2 ms. Por lo tanto, el retorno al pasar de m a l es algo menor que en los pasos n → s → m. Estas cifras respaldan n/s para la implementación en el borde y l/x para sistemas fijos donde la precisión es prioritaria.
Comparación cuantitativa con YOLOv8
Incluir los valores de YOLOv8 en la misma documentación de Ultralytics junto a los de YOLO11 hace que el cambio generacional sea más evidente.
| Modelo | mAP50-95 (v8 → v11) | Parámetros (v8 → v11) | FLOPs (v8 → v11) | Inferencia ONNX de CPU (v8 → v11) |
|---|---|---|---|---|
| n | 37,3 → 39,5 | 3,2M → 2,6M | 8,7B → 6,5B | 80,4ms → 56,1ms |
| s | 44,9 → 47,0 | 11,2M → 9,4M | 28,6 mil millones → 21,6 mil millones | 128,4 ms → 90,0 ms |
| metro | 50,2 → 51,5 | 25,9 millones → 20,1 millones | 78,9 mil millones → 68,1 mil millones | 234,7 ms → 183,2 ms |
| l | 52,9 → 53,4 | 43,7 millones → 25,3 millones | 165.1B → 87.2B | 375,2 ms → 238,6 ms |
| x | 53,9 → 54,7 | 68,2 millones → 56,9 millones | 257,8 mil millones → 195,3 mil millones | 479,1 ms → 462,8 ms |
Fuente: Documentación oficial de YOLOv8 y Documentación oficial de YOLO11 (COCO val2017, 640 px, inferencia ONNX en CPU para ambos).
Para el tamaño l, el número de parámetros se reduce de 43,7 millones a 25,3 millones, casi a la mitad, mientras que el mAP mejora ligeramente. Aquí es donde el efecto de eficiencia de parámetros de C3k2 y C2PSA es más visible. Para x, los parámetros y las operaciones de punto flotante (FLOPs) se reducen sustancialmente, pero el tiempo de inferencia en CPU mejora solo ligeramente, lo que sugiere que el cálculo de autoatención en C2PSA puede convertirse en un cuello de botella para modelos grandes.
En resumen, YOLO11 avanza hacia la consecución de un mAP al menos comparable con menos parámetros y FLOPs que YOLOv8. Eso no significa que siempre supere a YOLOv8: dependiendo de la tarea y el conjunto de datos, la generación anterior aún puede reportar una mayor precisión absoluta. El artículo sobre tendencias en detección de objetos (/es/blog/posts/trend-object-detection.html) también aborda este punto.
Ampliando YOLO11 más allá de la detección
YOLO11 no se limita a la detección de objetos. Al reemplazar solo la cabeza, manteniendo la misma estructura y cuello, el marco abarca la segmentación de instancias (YOLO11-seg), la estimación de pose (YOLO11-pose, que realiza regresión de coordenadas de puntos clave), la clasificación (YOLO11-cls), la detección de cuadros delimitadores orientados (YOLO11-obb, que también realiza regresión de la orientación de objetos inclinados) y el seguimiento en múltiples fotogramas. Dado que C3k2 y C2PSA mejoran la estructura, sus beneficios se comparten entre estas tareas. Esto también demuestra que YOLO11 está diseñado como una base común para el reconocimiento visual, en lugar de ser solo un modelo de detección.
8. Sus dificultades
YOLO11 conserva las debilidades comunes a la familia YOLO. Los objetos pequeños y distantes siguen siendo difíciles de detectar. Dado que la arquitectura reduce gradualmente la resolución, un objeto de tan solo unos pocos píxeles puede perder casi todas sus características distintivas al llegar a capas más profundas. C2PSA lo alivia parcialmente, pero no lo resuelve de raíz.
Las escenas densas con muchos objetos similares también presentan dificultades. DFL y CIoU mejoran la regresión de límites, pero los objetos vecinos cuyos límites se superponen, como una multitud o fruta densamente agrupada en un huerto, aún pueden generar falsas detecciones y errores.
La sensibilidad al cambio de dominio es un problema general en los detectores basados en CNN. La precisión puede disminuir drásticamente con condiciones de iluminación, clima o ángulos de cámara que difieren sustancialmente de los datos de entrenamiento. C2PSA no ofrece un campo receptivo tan amplio como la familia DETR basada en Transformer, por lo que YOLO11 puede ser menos robusto en este aspecto.
YOLO11 también se distribuye bajo la licencia AGPL-3.0. Si una implementación comercial requiere mantener el código fuente privado, se necesita la Licencia Empresarial de Ultralytics. Esto no es una debilidad técnica, sino una limitación práctica que se suele pasar por alto.
9. Cómo elegirlo en la práctica
Para dispositivos periféricos y robots con batería, la velocidad de inferencia y el número de parámetros suelen ser limitaciones, lo que convierte a YOLO11n/s en la primera opción. La inferencia de CPU del modelo n, de aproximadamente 56 ms, permite su funcionamiento en hardware integrado tipo Raspberry Pi, dependiendo del resto del sistema.
Para inspección aérea desde drones y otras plataformas móviles, la detección de objetos pequeños es fundamental. En lugar de simplemente elegir un modelo YOLO11 más grande, aumente la resolución de entrada o utilice la inferencia por teselas. Algunos informes indican que las variantes DETR con atención deformable tienen ventaja en este aspecto, por lo que RT-DETR y otras familias son comparaciones razonables cuando la precisión es la prioridad.
Para inspección con cámaras fijas en almacenes o fábricas, YOLO11l/x son opciones viables cuando se dispone de recursos de GPU y la precisión es prioritaria. Incluso en este caso, detectores basados en Transformer, como RF-DETR, han reportado más de 60 mAP en COCO, por lo que YOLO ya no es la única opción. Consulte el artículo sobre tendencias en detección de objetos para obtener más detalles.
Para investigación y creación de prototipos, la madurez del paquete Python de Ultralytics es una razón práctica para elegir YOLO11: el entrenamiento, la inferencia y la exportación se pueden expresar en pocas líneas. Cuando sus restricciones de licencia son aceptables, la rapidez para obtener una base de referencia funcional sigue siendo una gran ventaja.
10. Resumen en tres líneas
- YOLO11 mantiene la estructura de YOLOv8 (estructura básica, cuello y cabezal), reemplaza sus bloques básicos con C3k2 y añade atención espacial mediante C2PSA.
-
Su cabezal sin anclaje predice las distancias de contorno como el valor esperado de las distribuciones DFL, mientras que CIoU optimiza conjuntamente la superposición, la distancia al centro y la relación de aspecto.
-
La eficiencia de los parámetros mejora de n a x, pero los objetos pequeños, las escenas densas y el cambio de dominio siguen siendo desafíos comunes para los detectores de la familia YOLO.
Para una introducción más fundamental a la detección de objetos y la segmentación semántica, consulte Detección de objetos y segmentación semántica: una introducción. Para conocer las tendencias actuales en la familia YOLO, incluidos los enfoques sin NMS y la competencia de los modelos DETR, consulte el artículo Tendencias en la detección de objetos.
Referencias
- Documentación oficial de Ultralytics YOLO11
- Ultralytics: Guía de arquitectura de YOLO
- Ultralytics: Beneficios de YOLO11 como detector sin anclajes
- Configuración oficial del modelo YOLO11 (GitHub)
- YOLOv11 Desmitificado: Una guía práctica para la detección de objetos de alto rendimiento (arXiv:2604.03349)
- Pérdida focal generalizada: Aprendizaje de cuadros delimitadores cualificados y distribuidos para la detección densa de objetos (NeurIPS 2020, arXiv:2006.04388)
- Licencia de Ultralytics
¿Una puntuación de detección alta garantiza que la posición y la clase sean correctas?
Una puntuación es un resultado del modelo, no una garantía de corrección. Evalúa la precisión y la exhaustividad en diferentes umbrales por separado de la precisión de localización de los cuadros detectados.
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.