Contents — find the section you need

Die YOLO-Familie zählt nach wie vor zu den am weitesten verbreiteten Ansätzen für die praktische Objekterkennung. Die Entwicklung wurde seit YOLOv8 im Jahr 2023 kontinuierlich fortgesetzt. YOLO11, veröffentlicht von Ultralytics am 10. September 2024, behält die Struktur „Rückgrat → Hals → Kopf“ von YOLOv8 bei, überarbeitet jedoch die darin enthaltenen Bausteine. Dieser Artikel erläutert anhand von Primärinformationen aus der offiziellen Dokumentation und den YAML-Dateien der Modelldefinitionen sowie anhand von Gleichungen und Diagrammen, welche Änderungen und welche Merkmale in YOLO11 beibehalten wurden.

Dieser Artikel basiert auf der offiziellen Ultralytics-Dokumentation (docs.ultralytics.com), Konfigurationsdateien im offiziellen GitHub-Repository und dem Preprint „YOLOv11 Demystified“ (arXiv:2604.03349).

0. Lerninhalte

  • Die spezifischen Änderungen von YOLOv11 gegenüber YOLOv8, einschließlich C3k2 und C2PSA

  • Die Koordinatenvorhersage des ankerfreien Erkennungskopfes, einschließlich DFL

  • Die für das Training verwendeten Verlustfunktionen und Augmentierungsmethoden

  • Die Veränderung von Genauigkeit, Parameteranzahl und Geschwindigkeit in Abhängigkeit von den fünf Größen n/s/m/l/x anhand offizieller Messungen

Wann man YOLOv11 wählen und wann man eine Alternative in Betracht ziehen sollte

1. Was ist YOLOv11?

YOLOv11 ist eine Generation von Echtzeit-Objekterkennungsmodellen, die von Ultralytics entwickelt und veröffentlicht wurden. Es behält das dreistufige „Backbone-, Hals- und Kopf“-Design von YOLOv8 bei, ersetzt dessen Feature-Extraktionsblöcke durch den neu entwickelten C3k2 und fügt den räumlichen Aufmerksamkeitsblock C2PSA am Ende des Backbones hinzu. Die gleiche allgemeine Architektur deckt Detektion, Segmentierung, Pose-Schätzung, Klassifizierung, orientierte Begrenzungsrahmen (OBB) und Tracking in einem einzigen Framework ab.

2. Warum war diese Neugestaltung notwendig?

YOLOv8 wurde damals häufig als einstufiger Detektor mit einem guten Verhältnis von Genauigkeit zu Geschwindigkeit eingesetzt, jedoch gab es in zwei Bereichen noch Verbesserungspotenzial. Erstens die Parametereffizienz. Wenn die gleiche Genauigkeit mit weniger Parametern und FLOPs erreicht werden kann, wird der Einsatz auf Edge-Geräten und batteriebetriebenen Robotern praktikabler. Zweitens fehlte ein expliziter Mechanismus, um zu lernen, wo in einer Feature-Map der Fokus liegen soll. Das Backbone von YOLOv8 erzeugt Features mithilfe von Faltungen, verfügt aber über keinen dedizierten Mechanismus zur Trennung wichtiger Regionen vom Hintergrund. C3k2 und C2PSA beheben diese beiden Probleme.

3. Was ist die Eingabe?

Wie viele andere YOLO-Detektoren verwendet auch YOLO11 ein skaliertes und aufgefülltes RGB-Bild fester Größe (standardmäßig 640 × 640 Pixel). Sowohl beim Training als auch bei der Inferenz wird die Eingabe als gebündelter [B, 3, H, W]-Tensor verarbeitet. Eine spezielle Vorverarbeitung wie proprietäre Normalisierung oder Patch-Splitting ist nicht erforderlich: Bilder nach Standard-Augmentierungen wie Mosaic werden direkt an das Backbone übergeben.

4. Was sagt es voraus?

Für jedes Objekt im Bild enthält die Ausgabe eine Klasse, die Koordinaten des Begrenzungsrahmens und einen Konfidenzwert. YOLO11 verwendet einen entkoppelten Head, der die Klassifizierungs- und Box-Regressionszweige trennt. Es ist außerdem ankerfrei, sodass es Koordinaten direkt ohne vordefinierte Ankerboxen regressiert. Die Idee, den Abstand jedes Gitterpunkts zur Objektgrenze vorherzusagen, verbindet YOLO11 mit der FCOS-Familie ankerfreier Detektoren. Das Entfernen vordefinierter Bereiche für verschiedene Seitenverhältnisse und Skalierungen reduziert die Hyperparameter-Optimierung und kann die Generalisierung auf Objekte mit extremen Seitenverhältnissen verbessern.

5. Grundlegende Architektur

Wie YOLOv8 folgt auch YOLO11 der dreistufigen Struktur „Backbone → Neck → Head“. Die Änderung liegt im Inhalt dieser Stufen.

Diagram 1 · Use the button to switch views
YOLO11 basic pipeline Flow from a 640 by 640 input image through a backbone containing C3k2 blocks, SPPF, and C2PSA spatial attention, into multi-scale P3/P4/P5 features, bidirectional fusion in a PAN-FPN neck, and an anchor-free detection head. Input image 640×640 Backbone C3k2 blocks SPPF C2PSA (spatial attention) Multi-scale P3/P4/P5 Neck PAN-FPN C3k2 blocks High- and low-level features fused both ways Head Anchor-free Box branch: DFL Cls branch: depthwise separable convolution Class + box coordinates + confidence

Abbildung 1 – Backbone, Neck und Head von YOLO11. Die blau hervorgehobenen Kästchen zeigen die gegenüber YOLOv8 geänderten Teile. C3k2 ersetzt den Basisblock sowohl im Backbone als auch im Neck, während C2PSA am Ende des Backbones, direkt nach SPPF, hinzugefügt wird.

Der Backbone gibt Feature-Maps in drei Auflösungen aus: P3, P4 und P5. Der Neck (PAN-FPN: Path Aggregation Network + Feature Pyramid Network) fusioniert hoch- und niedrigauflösende Features in beide Richtungen, sodass dasselbe Netzwerk kleine und große Objekte erkennen kann. Dieses Multi-Scale-Fusionsskelett ist gegenüber YOLOv8 unverändert. Die Änderung besteht darin, dass C2f als Basisblock durch C3k2 ersetzt und C2PSA am Backbone-Ausgang eingefügt wurde.

6. Technische Details der Komponenten

C3k2 – eine Verallgemeinerung von C2f

YOLOv8 verwendete den C2f-Block mit seiner CSP-Struktur (Cross Stage Partial) als Basiseinheit. C2f teilt die Eingangskanäle in zwei Pfade auf, leitet einen durch mehrere Bottleneck-Blöcke, lässt den anderen als Shortcut und verkettet anschließend beide Ausgänge sowie die Zwischenausgänge jedes Bottlenecks, bevor sie mit einer 1×1-Faltung zusammengeführt werden.

YOLO11 behält das Konzept der wiederholten internen Blöcke bei, macht den internen Blocktyp jedoch konfigurierbar. In der offiziellen Modelldefinition (YAML) kann jeder Block innerhalb von C3k2, abhängig von den Konstruktorflags, einen der folgenden Typen annehmen:

  1. Ein normaler Bottleneck-Block (verwendet vom kleinen n-Modell)
  2. Ein C3k-Block (eine C3-Struktur mit konfigurierbarer Kernelgröße, verwendet mit c3k=True in den mittleren und größeren m/l/x-Modellen)
  3. Ein Bottleneck + PSABlock-Paar (verwendet innerhalb von C2PSA am Ende des Backbones)

Anders ausgedrückt: C3k2 ist ein generalisierter Block. Er behält das C2f-Konzept bei und ermöglicht es, dass seine internen Bottlenecks je nach Modellgröße und -position von leichten Blöcken bis hin zu Blöcken mit Aufmerksamkeitssteuerung reichen. Ein Implementierungsdetail ist, dass eine YAML-Konfiguration alle fünf Größen (n/s/m/l/x) durch Umschalten dieser internen Komponenten abdeckt.

C2PSA – Hinzufügen von räumlicher Aufmerksamkeit zum Backbone

C2PSA (Cross Stage Partial with Spatial Attention) ist ein neuer YOLOv8-Block, der direkt nach SPPF (Spatial Pyramid Pooling – Fast, einem Modul zur Erweiterung des rezeptiven Feldes durch verschiedene Pooling-Größen) eingefügt wird. C2PSA folgt ebenfalls einer CSP-Struktur: Ein Pfad durchläuft mehrere PSABlocks. Jeder PSABlock kombiniert Multi-Head Self-Attention (MHSA) mit einem zweischichtigen Feedforward-Netzwerk (FFN), die über Residualpfade verbunden sind.

z = x + \text{MHSA}(x), \qquad y = z + \text{FFN}(z)

Hierbei ist x das Eingabe-Feature, \text{MHSA} die Multi-Head Self-Attention und \text{FFN} das zweischichtige Feedforward-Netzwerk. Im Vergleich zum reinen Faltungs-Backbone von YOLOv8 nutzt C2PSA Self-Attention, um Beziehungen zwischen weit voneinander entfernten Positionen in einer Feature-Map direkt zu lernen. Es ergänzt das lokale rezeptive Feld der Faltung und hilft, die Gewichtung auf wichtige Bildbereiche zu konzentrieren.

Ankerfreier Detektionskopf und DFL

Der Detektionskopf von YOLO11 trennt Klassifizierung und Box-Regression in entkoppelte Zweige. Er verwendet keine vordefinierten Ankerboxen; stattdessen sagt jeder Gitterpunkt auf der Feature-Map direkt den Abstand zur Objektgrenze voraus. Für jede der vier Richtungen gibt der Box-Regressionszweig eine Wahrscheinlichkeitsverteilung über \text{reg\_max}=16 diskrete Bins aus und verwendet deren Erwartungswert als kontinuierlichen Abstand. Dies ist die Idee hinter Distribution Focal Loss (DFL), übernommen von YOLOv8 und von Li et al. in „Generalized Focal Loss“ (NeurIPS 2020) vorgeschlagen.

\hat{d} = \sum_{i=0}^{\text{reg\_max}-1} P(i) \cdot i, \qquad \sum_{i=0}^{\text{reg\_max}-1} P(i) = 1

Anstatt direkt einen einzelnen reellen Wert für den Abstand zu einer Grenze zu regressieren, lernt das Modell eine diskrete Verteilung über wahrscheinliche Bins. Dies stabilisiert das Training und ermöglicht es der Verteilung, Unsicherheiten bei Objekten mit uneindeutigen oder verdeckten Konturen auszudrücken. YOLO11 ändert außerdem den Klassifizierungszweig und verwendet nun eine tiefenweise separierbare Faltung. Dadurch werden die Anzahl der Parameter und der Rechenaufwand im Vergleich zur herkömmlichen Faltung reduziert.

Verlustfunktionen und Trainingsrezept

Der Trainingsverlust von YOLO11 ist eine gewichtete Summe aus CIoU-Verlust (Complete IoU) für die Box-Regression, DFL-Verlust für die Koordinatenverteilung und BCE-Verlust (Binary Cross-Entropy) für die Klassifizierung.

\mathcal{L} = \lambda_{box}\,\mathcal{L}_{CIoU} + \lambda_{dfl}\,\mathcal{L}_{DFL} + \lambda_{cls}\,\mathcal{L}_{BCE}

Der CIoU-Verlust bewertet neben dem IoU-Wert (Überlappungsverhältnis) auch den Abstand zwischen den Box-Mittelpunkten und die Übereinstimmung ihrer Seitenverhältnisse.

\mathcal{L}_{CIoU} = 1 - IoU + \frac{\rho^2(b, b^{gt})}{c^2} + \alpha v, \qquad v = \frac{4}{\pi^2}\left(\arctan\frac{w^{gt}}{h^{gt}} - \arctan\frac{w}{h}\right)^2

\rho(b, b^{gt}) ist der euklidische Abstand zwischen den vorhergesagten und den tatsächlichen Mittelpunkten der Boxen, c ist die Diagonale des kleinsten Rechtecks, das beide Boxen umschließt, v repräsentiert die Abweichung des Seitenverhältnisses und \alpha ist ein Koeffizient, der v mit zunehmendem IoU stärker gewichtet. Die alleinige Optimierung des IoU liefert bei nicht überlappenden Boxen nahezu keinen Gradienten; die Terme für Mittelpunktabstand und Seitenverhältnis mildern dieses Problem.

Das Training verwendet Augmentierungen wie Mosaic (Zusammenfügen mehrerer Bilder), MixUp (Überblenden zweier Bilder), Copy-Paste (Einfügen eines Objektbereichs in ein anderes Bild), RandAugment (automatische Auswahl zufälliger Transformationen) und Erasing (Entfernen eines zufälligen rechteckigen Bereichs). Diese Details folgen der Beschreibung in „YOLOv11 Demystified“ (arXiv:2604.03349).

7. Vergleich der Modellvarianten

YOLO11 ist in fünf Größen mit unterschiedlicher Parameteranzahl und unterschiedlichem Rechenaufwand verfügbar: n (Nano), s (Klein), m (Mittel), l (Groß) und x (Extra-Groß). Die folgenden Werte sind Benchmark-Ergebnisse aus der offiziellen Ultralytics-Dokumentation zu COCO val2017 mit einer Eingabeauflösung von 640 Pixeln.

Modell mAP50-95 Parameter FLOPs CPU ONNX-Inferenz T4 TensorRT-Inferenz
YOLO11n 39,5 2,6 Mio. 6,5 Mrd. 56,1 ± 0,8 ms 1,5 ± 0,0 ms
YOLO11s 47,0 9,4M 21,6B 90,0 ± 1,2 ms 2,5 ± 0,0 ms

YOLO11m | 51,5 | 20,1M | 68,1B | 183,2 ± 2,0 ms | 4,7 ± 0,1 ms |

YOLO11l | 53,4 | 25,3M | 87,2B | 238,6 ± 1,4 ms | 6,2 ± 0,1 ms |

YOLO11x | 54,7 | 56,9M | 195,3B | 462,8 ± 6,7 ms | 11,3 ± 0,2 ms |

Quelle: Offizielle Ultralytics YOLO11-Dokumentation. Die CPU-ONNX-Inferenz nutzt die ONNX-Runtime; die T4-TensorRT-Inferenz ist FP16 auf einer NVIDIA T4 GPU.

Zwei praktische Punkte sind hervorzuheben. Erstens steigt die Parameteranzahl von n auf x um etwa das 22-Fache, während mAP50-95 nur um etwa 15 Punkte von 39,5 auf 54,7 steigt: Genauigkeit und Modellgröße verhalten sich nicht linear zueinander. Zweitens ist der Unterschied zwischen m und l zu betrachten. Die Parameteranzahl steigt nur von 20,1 Mio. auf 25,3 Mio., während mAP von 51,5 auf 53,4 und die GPU-Inferenzzeit von 4,7 ms auf 6,2 ms zunimmt. Der Nutzen des Übergangs von m zu l ist daher etwas geringer als bei den Schritten n → s → m. Diese Zahlen sprechen für n/s für Edge-Einsätze und l/x für stationäre Systeme, bei denen Genauigkeit Priorität hat.

Quantitativer Vergleich mit YOLOv8

Die Angabe der YOLOv8-Werte in derselben Ultralytics-Dokumentation neben den YOLO11-Werten verdeutlicht den Generationswechsel.

Modell mAP50-95 (v8 → v11) Parameter (v8 → v11) FLOPs (v8 → v11) CPU ONNX-Inferenz (v8 → v11)
n 37,3 → 39,5 3,2 Mio. → 2,6 Mio. 8,7 Mrd. → 6,5 Mrd. 80,4 ms → 56,1 ms
s 44,9 → 47,0 11,2 Mio. → 9,4 Mio. 28,6B → 21,6B 128,4 ms → 90,0 ms
m 50,2 → 51,5 25,9 Mio. → 20,1 Mio. 78,9B → 68,1B 234,7 ms → 183,2 ms
l 52,9 → 53,4 43,7 Mio. → 25,3 Mio. 165,1B → 87,2B 375,2 ms → 238,6 ms
x 53,9 → 54,7 68,2 Mio. → 56,9 Mio. 257,8 B → 195,3 B 479,1 ms → 462,8 ms

Quelle: Offizielle YOLOv8-Dokumentation und Offizielle YOLO11-Dokumentation (COCO val2017, 640 px, CPU-ONNX-Inferenz für beide).

Bei der Modellgröße l sinkt die Parameteranzahl von 43,7 Mio. auf 25,3 Mio., also um fast die Hälfte, während sich die mittlere durchschnittliche Genauigkeit (mAP) leicht verbessert. Hier wird der Effekt der Parametereffizienz von C3k2 und C2PSA am deutlichsten sichtbar. Bei x sinken die Parameteranzahl und die FLOPs deutlich, die CPU-Inferenzzeit verbessert sich jedoch nur geringfügig. Dies deutet darauf hin, dass die Berechnung der Selbstaufmerksamkeit in C2PSA bei großen Modellen zu einem Flaschenhals werden kann.

Kurz gesagt, strebt YOLO11 danach, mit weniger Parametern und FLOPs als YOLOv8 eine mindestens vergleichbare mAP zu erreichen. Das bedeutet jedoch nicht, dass es YOLOv8 immer übertrifft: Je nach Aufgabe und Datensatz kann die ältere Generation weiterhin eine höhere absolute Genauigkeit aufweisen. Der Artikel zu Trends in der Objekterkennung (siehe Blogbeitrag) behandelt diesen Punkt ebenfalls.

YOLO11 erweitert sich über die Objekterkennung hinaus

YOLO11 beschränkt sich nicht auf die Objekterkennung. Durch den Austausch des Kopfes bei Beibehaltung des gleichen Rückgrats und Halses deckt das Framework Instanzsegmentierung (YOLO11-seg), Pose-Schätzung (YOLO11-pose, das Keypoint-Koordinaten regressiert), Klassifizierung (YOLO11-cls), orientierte Begrenzungsrahmenerkennung (YOLO11-obb, das auch die Orientierung geneigter Objekte regressiert) und Tracking über mehrere Frames ab. Da C3k2 und C2PSA das Rückgrat verbessern, profitieren alle diese Aufgaben von ihren Vorteilen. Dies zeigt auch, dass YOLO11 als Grundlage für die allgemeine visuelle Erkennung und nicht nur als Detektionsmodell konzipiert ist.

8. Schwächen

YOLO11 weist die für die YOLO-Familie typischen Schwächen auf. Kleine und weit entfernte Objekte bleiben problematisch. Da die Auflösung im Backbone schrittweise abnimmt, kann ein Objekt mit nur wenigen Pixeln Durchmesser fast alle seine charakteristischen Merkmale verlieren, sobald es tiefere Schichten erreicht. C2PSA mildert dies teilweise, löst das Problem aber nicht grundlegend.

Dichte Szenen mit vielen ähnlichen Objekten stellen ebenfalls eine Herausforderung dar. DFL und CIoU verbessern die Kantenerkennung, doch benachbarte Objekte mit überlappenden Kanten, wie beispielsweise eine Menschenmenge oder dicht gedrängtes Obst in einem Obstgarten, können weiterhin zu Fehldetektionen und Nichterkennungen führen.

Empfindlichkeit gegenüber Domänenverschiebungen ist ein generelles Problem für CNN-basierte Detektoren. Die Genauigkeit kann bei Beleuchtung, Wetter oder Kamerawinkeln, die sich deutlich von den Trainingsdaten unterscheiden, stark abfallen. C2PSA bietet kein so breites rezeptives Feld wie die Transformer-basierte DETR-Familie, daher ist YOLO11 in dieser Hinsicht möglicherweise weniger robust.

YOLO11 wird unter der AGPL-3.0-Lizenz veröffentlicht. Für den kommerziellen Einsatz, bei dem der Quellcode vertraulich bleiben soll, ist die Ultralytics Enterprise License erforderlich. Dies ist keine technische Schwäche, sondern eine praktische Einschränkung, die leicht übersehen werden kann.

9. Praktische Auswahl

Für Edge-Geräte und batteriebetriebene Roboter sind Inferenzgeschwindigkeit und Parameteranzahl in der Regel limitierende Faktoren, wodurch YOLO11n/s die erste Wahl darstellt. Die CPU-Inferenzzeit des n-Modells von ca. 56 ms ermöglicht den realistischen Einsatz auf Embedded-Hardware der Raspberry-Pi-Klasse, abhängig von der restlichen Systemkonfiguration.

Für die Luftinspektion von Drohnen und anderen beweglichen Plattformen ist die Erkennung kleiner Objekte von zentraler Bedeutung. Anstatt einfach ein größeres YOLO11-Modell zu wählen, sollte die Eingabeauflösung erhöht oder eine gekachelte Inferenz verwendet werden. Einigen Berichten zufolge haben Varianten von DETR mit deformierbarer Aufmerksamkeit in diesem Bereich einen Vorteil. Daher sind RT-DETR und andere Familien sinnvolle Vergleichsoptionen, wenn Genauigkeit Priorität hat.

Für Inspektionen mit fest installierten Lager- oder Fabrikkameras sind YOLO11l/x Optionen, wenn GPU-Ressourcen verfügbar sind und Genauigkeit im Vordergrund steht. Selbst hier haben Transformer-basierte Detektoren wie RF-DETR auf COCO mehr als 60 mAP erreicht, sodass YOLO nicht mehr die einzige Wahl ist. Weitere Informationen finden Sie im Artikel zu Trends in der Objekterkennung.

Für Forschung und Prototyping ist die ausgereifte Python-Bibliothek von Ultralytics ein praktischer Grund, YOLO11 zu wählen: Training, Inferenz und Export lassen sich mit wenigen Zeilen Code realisieren. Sofern die Lizenzbeschränkungen akzeptabel sind, bleibt die schnelle Erstellung einer funktionierenden Baseline ein großer Vorteil.

10. Dreizeilige Zusammenfassung

  • YOLO11 behält die Struktur von YOLOv8 (Rückgrat-Hals-Kopf) bei, ersetzt seine Basisblöcke durch C3k2 und ergänzt die räumliche Aufmerksamkeit durch C2PSA.

  • Der ankerfreie Kopf sagt Randabstände als Erwartungswert von DFL-Verteilungen voraus, während CIoU Überlappung, Mittelpunktabstand und Seitenverhältnis gemeinsam optimiert.

  • Die Parametereffizienz verbessert sich von n auf x, aber kleine Objekte, dichte Szenen und Domänenverschiebungen bleiben häufige Herausforderungen für Detektoren der YOLO-Familie.

Eine grundlegendere Einführung in Objekterkennung und semantische Segmentierung finden Sie unter Objekterkennung und semantische Segmentierung: Eine Einführung. Aktuelle Trends innerhalb der YOLO-Familie, einschließlich NMS-freier Ansätze und der Konkurrenz durch DETR-Modelle, finden Sie im Artikel Artikel zu Trends in der Objekterkennung.

Referenzen

Überprüfen Sie Ihr Verständnis
Garantiert ein hoher Erkennungswert die korrekte Position und Klasse?

Ein Wert ist ein Modellergebnis, keine Garantie für Korrektheit. Bewerten Sie Präzision und Trefferquote bei verschiedenen Schwellenwerten getrennt von der Lokalisierungsgenauigkeit der erkannten Boxen.

What to read next

Review the backgroundEinführung in Objekterkennung und semantische Segmentierung – Lesen der Frage „Was ist wo?“ aus einem BildContinue the seriesEin ausführlicher Leitfaden zu SegFormer – Warum ein Transformer ohne Positionskodierung für die Segmentierung funktioniertExplore another aspect of this fieldBenchmark für lokale LLMs: Erste Antwortzeit, Generierungsrate und Speicher