Contents — find the section you need

La famille YOLO demeure l'une des approches les plus utilisées pour la détection d'objets, et son développement se poursuit depuis YOLOv8 en 2023. Publié par Ultralytics le 10 septembre 2024, YOLO11 conserve la même structure « colonne vertébrale → cou → tête » que YOLOv8, tout en repensant ses blocs internes. Cet article examine les modifications apportées par YOLO11 et les éléments conservés, en s'appuyant sur les informations issues de la documentation officielle et des fichiers YAML de définition du modèle, ainsi que sur des équations et des diagrammes.

Cet article s'appuie sur la documentation officielle d'Ultralytics (docs.ultralytics.com), les fichiers de configuration du dépôt GitHub officiel et la prépublication « YOLOv11 Demystified » (arXiv:2604.03349).

0. Ce que vous apprendrez

  • Les changements spécifiques apportés par YOLO11 par rapport à YOLOv8, notamment C3k2 et C2PSA

  • Le fonctionnement de la tête de détection sans ancrage pour la prédiction des coordonnées, y compris DFL

  • Les fonctions de perte et les méthodes d'augmentation utilisées pour l'entraînement

L'évolution de la précision, du nombre de paramètres et de la vitesse selon les cinq tailles (n/s/m/l/x), à partir de mesures officielles

Quand choisir YOLO11 et quand envisager une autre option

1. Qu'est-ce que YOLO11 ?

YOLO11 est une nouvelle génération de modèles de détection d'objets en temps réel, développée et publiée par Ultralytics. Il conserve la conception en trois étapes « colonne vertébrale, cou et tête » de YOLOv8, remplace ses blocs d'extraction de caractéristiques par le nouveau C3k2 et ajoute le bloc d'attention spatiale C2PSA à l'extrémité de la colonne vertébrale. La même architecture générale couvre la détection, la segmentation, l'estimation de pose, la classification, les boîtes englobantes orientées (OBB) et le suivi au sein d'un même cadre.

2. Pourquoi cette refonte était-elle nécessaire ?

À l'époque, YOLOv8 était largement utilisé comme détecteur mono-étape offrant un bon compromis précision-vitesse, mais deux points restaient perfectibles. Le premier concernait l'efficacité des paramètres. Si la même précision peut être atteinte avec moins de paramètres et d'opérations en virgule flottante (FLOPs), le déploiement sur des dispositifs embarqués et des robots alimentés par batterie devient plus pratique. Le second était l'absence de mécanisme explicite pour apprendre où se concentrer dans une carte de caractéristiques. La colonne vertébrale de YOLOv8 construit les caractéristiques par convolution, mais ne dispose d'aucun mécanisme dédié pour séparer les régions importantes de l'arrière-plan. C3k2 et C2PSA traitent respectivement ces deux problèmes.

3. Quelle est l'entrée ?

Comme de nombreux autres détecteurs YOLO, YOLO11 prend en entrée une image RGB redimensionnée et complétée, de taille fixe (640 × 640 pixels par défaut). Lors de l'entraînement et de l'inférence, l'entrée est traitée comme un tenseur [B, 3, H, W] par lots. Aucun prétraitement particulier, tel qu'une normalisation propriétaire ou un découpage en patchs, n'est requis : les images après augmentation de données standard, comme Mosaic, sont directement transmises au réseau de base.

4. Que prédit-il ?

Pour chaque objet de l'image, la sortie contient une classe, les coordonnées de sa boîte englobante et un score de confiance. YOLO11 utilise une tête découplée qui sépare les branches de classification et de régression. Il est également sans ancrage, ce qui lui permet de régresser directement les coordonnées sans boîtes d'ancrage prédéfinies. L'idée de prédire la distance entre chaque point de la grille et le contour de l'objet rapproche YOLO11 de la famille FCOS de détecteurs sans ancrage. La suppression des boîtes prédéfinies pour plusieurs rapports d'aspect et échelles réduit le réglage des hyperparamètres et peut améliorer la généralisation aux objets aux rapports d'aspect extrêmes.

5. Architecture de base

Comme YOLOv8, YOLO11 suit la structure en trois étapes « colonne vertébrale → cou → tête ». La différence réside dans le contenu de ces étapes.

Diagram 1 · Use the button to switch views
YOLO11 basic pipeline Flow from a 640 by 640 input image through a backbone containing C3k2 blocks, SPPF, and C2PSA spatial attention, into multi-scale P3/P4/P5 features, bidirectional fusion in a PAN-FPN neck, and an anchor-free detection head. Input image 640×640 Backbone C3k2 blocks SPPF C2PSA (spatial attention) Multi-scale P3/P4/P5 Neck PAN-FPN C3k2 blocks High- and low-level features fused both ways Head Anchor-free Box branch: DFL Cls branch: depthwise separable convolution Class + box coordinates + confidence

Figure 1 — Structure principale, col et tête de YOLO11. Les encadrés bleus mettent en évidence les parties modifiées par rapport à YOLOv8. C3k2 remplace le bloc de base dans la structure principale et le col, tandis que C2PSA est ajouté à la fin de la structure principale, immédiatement après SPPF.

La structure principale génère des cartes de caractéristiques à trois résolutions : P3, P4 et P5. Le col (PAN-FPN : Path Aggregation Network + Feature Pyramid Network) fusionne les caractéristiques haute et basse résolution dans les deux directions, permettant ainsi au même réseau de détecter les petits et les grands objets. Ce squelette de fusion multi-échelle est identique à celui de YOLOv8. Les modifications apportées sont le remplacement de C2f par C3k2 comme bloc de base et l’insertion de C2PSA à la sortie de la structure principale.

6. Détails techniques des composants

C3k2 — une généralisation de C2f

YOLOv8 utilisait le bloc C2f, doté d'une structure CSP (Cross Stage Partial), comme unité de base. C2f divise les canaux d'entrée en deux chemins, en achemine un à travers plusieurs blocs Bottleneck, et conserve l'autre comme raccourci. Il concatène ensuite les deux sorties ainsi que les sorties intermédiaires de chaque Bottleneck avant de les fusionner par une convolution 1 × 1.

YOLO11 conserve le principe de répétition des blocs internes, mais rend le type de bloc interne configurable. Dans la définition officielle du modèle (YAML), chaque bloc de C3k2 peut être l'un des suivants, selon les options du constructeur :

  1. Un bloc Bottleneck standard (utilisé par le modèle n petit)

  2. Un bloc C3k (une structure C3 avec une taille de noyau configurable, utilisée avec c3k=True dans les modèles m/l/x moyens et grands)

  3. Une paire Bottleneck + PSABlock (utilisée dans C2PSA à la fin du réseau principal)

Autrement dit, C3k2 est un bloc généralisé : il conserve le principe de C2f tout en permettant à ses goulots d'étranglement internes de varier, allant de blocs légers à des blocs dotés d'un système d'attention, en fonction de la taille et de l'emplacement du modèle. Un détail d'implémentation : une seule configuration YAML couvre les cinq tailles (n/s/m/l/x) en modifiant ces composants internes.

C2PSA — Ajout d'attention spatiale au réseau de base

C2PSA (Cross Stage Partial with Spatial Attention) est un nouveau bloc YOLO11 inséré immédiatement après SPPF (Spatial Pyramid Pooling - Fast, un module qui étend le champ réceptif avec plusieurs tailles de pooling). C2PSA suit également une structure CSP : un chemin traverse plusieurs PSABlocks. Chaque PSABlock combine l'auto-attention multi-têtes (MHSA) et un réseau de neurones à propagation avant à deux couches (FFN), connectés par des chemins résiduels.

z = x + \text{MHSA}(x), \qquad y = z + \text{FFN}(z)

Ici, x représente la caractéristique d'entrée, \text{MHSA} l'auto-attention multi-têtes et \text{FFN} le réseau de neurones à propagation avant à deux couches. Contrairement au réseau de base de YOLOv8, composé uniquement de convolutions, C2PSA utilise l'auto-attention pour apprendre directement les relations entre les positions distantes dans une carte de caractéristiques. Elle complète le champ réceptif local de la convolution et permet de concentrer l'attention sur les régions importantes de l'image.

Tête de détection sans ancrage et DFL

La tête de détection de YOLO11 sépare la classification et la régression de boîtes en branches découplées. Elle n'utilise pas de boîtes d'ancrage prédéfinies ; au lieu de cela, chaque point de la grille de la carte de caractéristiques prédit directement la distance à la limite de l'objet. Pour chacune des quatre directions, la branche de régression de boîtes génère une distribution de probabilité sur \text{reg\_max}=16 classes discrètes et utilise sa valeur attendue comme distance continue. C'est le principe de la perte focale distribuée (DFL), héritée de YOLOv8 et proposée par Li et al. dans « Generalized Focal Loss » (NeurIPS 2020).

\hat{d} = \sum_{i=0}^{\text{reg\_max}-1} P(i) \cdot i, \qquad \sum_{i=0}^{\text{reg\_max}-1} P(i) = 1

Plutôt que de régresser directement une seule valeur réelle pour la distance à une limite, le modèle apprend une distribution discrète sur des classes probables. Cela stabilise l'entraînement tout en permettant à la distribution d'exprimer l'incertitude pour les objets aux contours ambigus ou occlus. YOLO11 modifie également la branche de classification pour utiliser une convolution séparable en profondeur, réduisant ainsi le nombre de paramètres et la complexité de calcul par rapport à une convolution classique.

Fonctions de perte et méthode d'entraînement

La perte d'entraînement de YOLO11 est une somme pondérée de la perte CIoU (IoU complet) pour la régression des boîtes, de la perte DFL pour la distribution des coordonnées et de la perte BCE (entropie croisée binaire) pour la classification.

\mathcal{L} = \lambda_{box}\,\mathcal{L}_{CIoU} + \lambda_{dfl}\,\mathcal{L}_{DFL} + \lambda_{cls}\,\mathcal{L}_{BCE}

La perte CIoU évalue non seulement l'IoU (taux de recouvrement), mais aussi la distance entre les centres des boîtes et la correspondance de leurs proportions.

\mathcal{L}_{CIoU} = 1 - IoU + \frac{\rho^2(b, b^{gt})}{c^2} + \alpha v, \qquad v = \frac{4}{\pi^2}\left(\arctan\frac{w^{gt}}{h^{gt}} - \arctan\frac{w}{h}\right)^2

\rho(b, b^{gt}) représente la distance euclidienne entre les centres des boîtes prédites et réelles, c la longueur de la diagonale du plus petit rectangle contenant les deux boîtes, v le décalage du rapport hauteur/largeur, et \alpha un coefficient qui pondère v davantage à mesure que IoU augmente. L'optimisation de l'IoU seule ne produit quasiment aucun gradient lorsque les boîtes ne se chevauchent pas ; les termes de distance entre les centres et de rapport hauteur/largeur atténuent ce problème.

L'entraînement utilise des augmentations de données, notamment Mosaic (assemblage de plusieurs images), MixUp (fusion de deux images), Copy-Paste (insertion d'une région d'objet dans une autre image), RandAugment (sélection automatique de transformations aléatoires) et Erasing (suppression d'une région rectangulaire aléatoire). Ces détails font suite à la description de « YOLOv11 Demystified » (arXiv:2604.03349).

7. Comparaison des variantes du modèle

YOLO11 est disponible en cinq tailles, chacune avec un nombre de paramètres et des exigences de calcul différents : n (nano), s (small), m (medium), l (large) et x (extra-large). Voici les valeurs de référence issues de la documentation officielle d’Ultralytics sur COCO val2017 avec une entrée de 640 px.

Modèle mAP50-95 Paramètres FLOPs Inférence CPU ONNX Inférence T4 TensorRT
YOLO11n 39,5 2,6 M 6,5 B 56,1 ± 0,8 ms 1,5 ± 0,0 ms
YOLO11s 47,0 9,4M 21,6B 90,0 ± 1,2 ms 2,5 ± 0,0 ms
YOLO11m 51,5 20,1M 68,1B 183,2 ± 2,0 ms 4,7 ± 0,1 ms
YOLO11l 53,4 25,3M 87,2B 238,6 ± 1,4 ms 6,2 ± 0,1 ms
YOLO11x 54,7 56,9M 195,3B 462,8 ± 6,7 ms 11,3 ± 0,2 ms

Source : Documentation officielle d'Ultralytics YOLO11. L'inférence ONNX sur CPU utilise ONNX Runtime ; l'inférence TensorRT T4 est en FP16 sur un GPU NVIDIA T4.

Deux points pratiques sont à noter. Premièrement, le nombre de paramètres est multiplié par environ 22 entre n et x, tandis que le mAP50-95 n'augmente que d'environ 15 points, passant de 39,5 à 54,7 : la précision et la taille du modèle ne sont pas liées linéairement. Deuxièmement, considérons l'écart entre m et l. Le nombre de paramètres n'augmente que de 20,1 millions à 25,3 millions, tandis que le mAP passe de 51,5 à 53,4 et le temps d'inférence GPU de 4,7 ms à 6,2 ms. Le gain en passant de m à l est donc légèrement inférieur à celui obtenu lors des étapes n → s → m. Ces valeurs justifient l'utilisation de n/s pour les déploiements en périphérie et de l/x pour les systèmes fixes où la précision est prioritaire.

Comparaison quantitative avec YOLOv8

Le fait de présenter les valeurs de YOLOv8 issues de la documentation Ultralytics à côté de celles de YOLO11 rend le changement de génération plus concret.

Modèle mAP50-95 (v8 → v11) Paramètres (v8 → v11) FLOPs (v8 → v11) Inférence CPU ONNX (v8 → v11)
n 37,3 → 39,5 3,2 M → 2,6 M 8,7 octets → 6,5 octets 80,4 ms → 56,1 ms
s 44,9 → 47,0 11,2 M → 9,4 M 28,6B → 21,6B 128,4 ms → 90,0 ms
m 50,2 → 51,5 25,9 millions → 20,1 millions 78,9B → 68,1B 234,7 ms → 183,2 ms
l 52,9 → 53,4 43,7M → 25,3M 165,1B → 87,2B 375,2 ms → 238,6 ms
X 53,9 → 54,7 68,2 millions → 56,9 millions 257,8B → 195,3B 479,1 ms → 462,8 ms

Source : Documentation officielle de YOLOv8 et Documentation officielle de YOLO11 (COCO val2017, 640 px, inférence CPU ONNX pour les deux).

Pour la taille l, le nombre de paramètres passe de 43,7 millions à 25,3 millions, soit presque la moitié, tandis que la mAP s'améliore légèrement. C'est ici que l'effet d'efficacité paramétrique de C3k2 et C2PSA est le plus visible. Pour x, le nombre de paramètres et le nombre d'opérations en virgule flottante (FLOPs) diminuent considérablement, mais le temps d'inférence CPU ne s'améliore que légèrement, ce qui suggère que le calcul d'auto-attention dans C2PSA peut devenir un goulot d'étranglement pour les grands modèles.

En résumé, YOLO11 tend à atteindre une mAP au moins comparable avec moins de paramètres et de FLOPs que YOLOv8. Cela ne signifie pas pour autant qu'il surpasse systématiquement YOLOv8 : selon la tâche et le jeu de données, la génération précédente peut encore afficher une précision absolue supérieure. L'article sur les tendances en détection d'objets aborde également ce point.

Extension de YOLO11 au-delà de la détection

YOLO11 ne se limite pas à la détection d'objets. En remplaçant uniquement la tête tout en conservant le même squelette et le même cou, le framework couvre la segmentation d'instances (YOLO11-seg), l'estimation de pose (YOLO11-pose, qui régresse les coordonnées des points clés), la classification (YOLO11-cls), la détection de boîtes englobantes orientées (YOLO11-obb, qui régresse également l'orientation des objets inclinés) et le suivi sur plusieurs images. Les améliorations apportées au squelette par C3k2 et C2PSA profitent à l'ensemble de ces tâches. Ceci démontre également que YOLO11 est conçu comme une base commune de reconnaissance visuelle, et non comme un simple modèle de détection.

8. Ses points faibles

YOLO11 conserve les faiblesses communes à la famille YOLO. Les objets petits et éloignés restent difficiles à détecter. La résolution étant progressivement réduite par le réseau de base, un objet de quelques pixels seulement peut perdre presque toutes ses caractéristiques distinctives lorsqu'il atteint les couches profondes. C2PSA atténue partiellement ce problème, mais ne le résout pas fondamentalement.

Les scènes denses comportant de nombreux objets similaires représentent également un défi. DFL et CIoU améliorent la régression des contours, mais les objets voisins dont les contours se chevauchent, comme une foule ou des fruits serrés dans un verger, peuvent encore générer des détections erronées et des omissions.

La sensibilité au changement de domaine est un problème général pour les détecteurs basés sur les CNN. La précision peut chuter brutalement en cas d'éclairage, de conditions météorologiques ou d'angles de caméra sensiblement différents des données d'entraînement. C2PSA n'offre pas un champ réceptif aussi large que la famille DETR basée sur les Transformers ; YOLO11 peut donc être moins robuste à cet égard.

YOLO11 est également distribué sous licence AGPL-3.0. Si un déploiement commercial exige la confidentialité du code source, la licence Ultralytics Enterprise est requise. Il ne s'agit pas d'une faiblesse technique, mais d'une contrainte pratique souvent négligée.

9. Comment le choisir en pratique

Pour les dispositifs périphériques et les robots alimentés par batterie, la vitesse d'inférence et le nombre de paramètres sont généralement des contraintes, ce qui fait de YOLO11n/s le premier choix. L'inférence CPU d'environ 56 ms du modèle n permet une utilisation réaliste sur du matériel embarqué de type Raspberry Pi, en fonction du reste du système.

Pour l'inspection aérienne par drones et autres plateformes mobiles, la détection de petits objets est essentielle. Plutôt que de simplement choisir un modèle YOLO11 plus grand, il est préférable d'augmenter la résolution d'entrée ou d'utiliser l'inférence par tuiles. Certains rapports attribuent un avantage aux variantes DETR à attention déformable dans ce domaine ; RT-DETR et d'autres familles similaires constituent donc des comparaisons pertinentes lorsque la précision est la priorité.

Pour l'inspection avec des caméras fixes d'entrepôt ou d'usine, YOLO11l/x sont des options intéressantes lorsque les ressources GPU sont disponibles et que la précision est primordiale. Même dans ce cas, des détecteurs basés sur l'architecture Transformer, tels que RF-DETR, ont atteint un mAP supérieur à 60 sur COCO ; YOLO n'est donc plus la seule solution. Consultez l'article sur les tendances en détection d'objets pour plus de détails.

Pour la recherche et le prototypage, la maturité du package Python d'Ultralytics constitue un argument de poids en faveur de YOLO11 : l'entraînement, l'inférence et l'exportation peuvent être réalisés en quelques lignes de code. Lorsque ses contraintes de licence sont acceptables, la rapidité d'obtention d'une configuration de base fonctionnelle demeure un atout majeur.

10. Récapitulatif en trois lignes

  • YOLO11 conserve la structure de base (colonne centrale, cou et tête) de YOLOv8, remplace ses blocs de base par C3k2 et ajoute l'attention spatiale via C2PSA.

Sa tête sans ancrage prédit les distances aux limites comme la valeur attendue des distributions DFL, tandis que CIoU optimise conjointement le chevauchement, la distance au centre et le rapport d'aspect.

L'efficacité des paramètres s'améliore de n à x, mais les petits objets, les scènes denses et les changements de domaine restent des défis courants pour les détecteurs de la famille YOLO.

Pour une introduction plus fondamentale à la détection d'objets et à la segmentation sémantique, voir Détection d'objets et segmentation sémantique : une introduction. Pour connaître les tendances actuelles au sein de la famille YOLO, notamment les approches sans NMS et la concurrence des modèles DETR, voir l'article sur les tendances de la détection d'objets.

Références

Vérifiez votre compréhension
Un score de détection élevé garantit-il l'exactitude de la position et de la classe ?

Un score est un résultat du modèle, et non une garantie d'exactitude. Évaluez la précision et le rappel à différents seuils, indépendamment de la précision de localisation des boîtes détectées.

What to read next

Review the backgroundIntroduction à la détection d'objets et à la segmentation sémantique — Interpréter « Qu'est-ce qui est où » à partir d'une imageContinue the seriesGuide complet de SegFormer — Pourquoi un transformateur sans encodage positionnel fonctionne pour la segmentationExplore another aspect of this fieldÉvaluation comparative des LLM locaux : temps de réponse initial, taux de génération et mémoire