Contents — find the section you need
Keluarga YOLO tetap menjadi salah satu pendekatan yang paling banyak digunakan untuk deteksi objek praktis, dan pengembangannya terus berlanjut sejak YOLOv8 pada tahun 2023. Dirilis oleh Ultralytics pada 10 September 2024, YOLO11 mempertahankan kerangka "tulang punggung → leher → kepala" yang sama seperti YOLOv8 sambil mendesain ulang blok-blok di dalamnya. Artikel ini memverifikasi apa yang diubah dan dipertahankan oleh YOLO11, menggunakan informasi utama dari dokumentasi resmi dan file YAML definisi model, dengan persamaan dan diagram.
Artikel ini didasarkan pada dokumentasi resmi Ultralytics (docs.ultralytics.com), file konfigurasi di repositori GitHub resmi, dan preprint “YOLOv11 Demystified” (arXiv:2604.03349).
0. Apa yang akan Anda pelajari
- Perubahan spesifik YOLO11 dari YOLOv8, termasuk C3k2 dan C2PSA
- Bagaimana kepala deteksi tanpa jangkar memprediksi koordinat, termasuk DFL
- Fungsi kerugian dan metode augmentasi yang digunakan untuk pelatihan
- Bagaimana akurasi, jumlah parameter, dan kecepatan berubah di kelima ukuran n/s/m/l/x, menggunakan pengukuran resmi
- Kapan memilih YOLO11 dan kapan mempertimbangkan opsi lain
1. Apa itu YOLO11?
YOLO11 adalah generasi model deteksi objek real-time yang dikembangkan dan dirilis oleh Ultralytics. Desain ini mempertahankan desain tiga tahap “tulang punggung, leher, dan kepala” dari YOLOv8, mengganti blok ekstraksi fiturnya dengan C3k2 yang baru dirancang, dan menambahkan blok perhatian spasial C2PSA di akhir tulang punggung. Arsitektur umum yang sama mencakup deteksi, segmentasi, estimasi pose, klasifikasi, bounding box berorientasi (OBB), dan pelacakan dalam satu kerangka kerja.
2. Mengapa desain ulang ini diperlukan?
Pada saat itu, YOLOv8 banyak digunakan sebagai detektor satu tahap dengan keseimbangan akurasi-kecepatan yang kuat, tetapi dua area masih memiliki ruang untuk perbaikan. Yang pertama adalah efisiensi parameter. Jika akurasi yang sama dapat dicapai dengan lebih sedikit parameter dan FLOPs, penerapan pada perangkat edge dan robot bertenaga baterai menjadi lebih praktis. Yang kedua adalah kurangnya mekanisme eksplisit untuk mempelajari di mana harus fokus dalam peta fitur. Tulang punggung YOLOv8 membangun fitur dengan konvolusi, tetapi tidak memiliki mekanisme khusus untuk memisahkan wilayah penting dari latar belakang. C3k2 dan C2PSA masing-masing mengatasi kedua masalah ini.
3. Apa inputnya?
Seperti banyak detektor YOLO lainnya, YOLO11 menerima gambar RGB yang telah diubah ukurannya dan diberi padding dengan ukuran tetap (640 × 640 piksel secara default). Selama pelatihan dan inferensi, input ditangani sebagai tensor [B, 3, H, W] yang dikelompokkan. Tidak diperlukan pra-pemrosesan khusus seperti normalisasi khusus atau pemisahan patch: gambar setelah augmentasi standar seperti Mosaic langsung diteruskan ke backbone.
4. Apa yang diprediksinya?
Untuk setiap objek dalam gambar, output berisi kelas, koordinat bounding box, dan skor kepercayaan. YOLO11 menggunakan head yang terpisah yang memisahkan cabang klasifikasi dan regresi kotak. Ia juga bebas anchor, sehingga langsung meregresikan koordinat tanpa anchor box yang telah ditentukan sebelumnya. Ide memprediksi jarak dari setiap lokasi grid ke batas objek menghubungkan YOLO11 dengan keluarga detektor tanpa jangkar FCOS. Menghapus kotak yang telah ditentukan sebelumnya untuk beberapa rasio aspek dan skala mengurangi penyetelan hyperparameter dan dapat meningkatkan generalisasi ke objek dengan rasio aspek ekstrem.
5. Arsitektur dasar
Seperti YOLOv8, YOLO11 mengikuti struktur tiga tahap “tulang punggung → leher → kepala”. Perubahannya terletak pada isi dari tahap-tahap tersebut.
Gambar 1 — Tulang punggung, leher, dan kepala YOLO11. Kotak biru yang diberi penekanan adalah bagian yang diubah dari YOLOv8. C3k2 menggantikan blok dasar di tulang punggung dan leher, sementara C2PSA ditambahkan di akhir tulang punggung, tepat setelah SPPF.
Tulang punggung menghasilkan peta fitur pada tiga resolusi, P3, P4, dan P5. Leher (PAN-FPN: Path Aggregation Network + Feature Pyramid Network) menggabungkan fitur resolusi tinggi dan rendah di kedua arah, memungkinkan jaringan yang sama untuk mendeteksi objek kecil dan besar. Kerangka fusi multi-skala ini tidak berubah dari YOLOv8. Yang berubah adalah C2f digantikan oleh C3k2 sebagai blok dasar, dan C2PSA dimasukkan pada output utama.
6. Detail teknis komponen
C3k2 — generalisasi dari C2f
YOLOv8 menggunakan blok C2f, yang memiliki struktur CSP (Cross Stage Partial), sebagai unit dasarnya. C2f membagi saluran input menjadi dua jalur, mengirim satu melalui beberapa blok Bottleneck, membiarkan yang lain sebagai jalan pintas, kemudian menggabungkan kedua output dan output perantara dari setiap Bottleneck sebelum menggabungkannya dengan konvolusi 1 × 1.
YOLO11 mempertahankan ide pengulangan blok internal, tetapi membuat tipe blok internal dapat dikonfigurasi. Dalam definisi model resmi (YAML), setiap blok di dalam C3k2 dapat berupa salah satu dari berikut ini, tergantung pada flag konstruktor:
Bottlenecknormal (digunakan oleh model n kecil)- Blok
C3k(struktur C3 dengan ukuran kernel yang dapat dikonfigurasi, digunakan denganc3k=Truepada model m/l/x sedang dan besar) - Pasangan
Bottleneck + PSABlock(digunakan di dalam C2PSA di akhir backbone)
Dengan kata lain, C3k2 adalah blok yang digeneralisasi: ia mempertahankan ide C2f sambil memungkinkan Bottleneck internalnya berkisar dari blok ringan hingga blok yang dilengkapi dengan attention sesuai dengan ukuran dan penempatan model. Detail implementasinya adalah bahwa satu konfigurasi YAML mencakup kelima ukuran, n/s/m/l/x, dengan mengganti komponen internal ini.
C2PSA — menambahkan perhatian spasial ke backbone
C2PSA (Cross Stage Partial with Spatial Attention) adalah blok YOLO11 baru yang disisipkan segera setelah SPPF (Spatial Pyramid Pooling - Fast, modul yang memperluas bidang reseptif dengan beberapa ukuran pooling). C2PSA juga mengikuti struktur CSP: satu jalur melewati beberapa PSABlock. Setiap PSABlock menggabungkan multi-head self-attention (MHSA) dan jaringan feed-forward dua lapis (FFN), yang dihubungkan dengan jalur residual.
Di sini x adalah fitur input, \text{MHSA} adalah multi-head self-attention, dan \text{FFN} adalah jaringan feed-forward dua lapis. Dibandingkan dengan backbone YOLOv8 yang hanya menggunakan konvolusi, C2PSA menggunakan self-attention untuk mempelajari hubungan antara posisi yang berjauhan dalam peta fitur secara langsung. Ini melengkapi bidang reseptif lokal konvolusi dan membantu memusatkan bobot pada wilayah penting gambar.
Kepala deteksi tanpa jangkar dan DFL
Kepala deteksi YOLO11 memisahkan klasifikasi dan regresi kotak ke dalam cabang yang terpisah. Ia tidak menggunakan kotak jangkar yang telah ditentukan sebelumnya; sebaliknya, setiap titik grid pada peta fitur secara langsung memprediksi jarak ke batas objek. Untuk masing-masing dari empat arah, cabang regresi kotak menghasilkan distribusi probabilitas atas bin diskrit dan menggunakan nilai yang diharapkan sebagai jarak kontinu. Ini adalah ide di balik Distribution Focal Loss (DFL), yang diwarisi dari YOLOv8 dan diusulkan oleh Li dkk. dalam "Generalized Focal Loss" (NeurIPS 2020).
Alih-alih langsung meregresikan satu nilai riil untuk jarak ke batas, model mempelajari distribusi diskrit atas bin yang mungkin. Hal ini membuat pelatihan lebih stabil sekaligus memungkinkan distribusi untuk mengekspresikan ketidakpastian untuk objek dengan kontur yang ambigu atau terhalang. YOLO11 juga mengubah cabang klasifikasi untuk menggunakan konvolusi yang dapat dipisahkan secara mendalam (depthwise-separable convolution), mengurangi jumlah parameter dan komputasi dibandingkan dengan konvolusi biasa.
Fungsi kerugian dan resep pelatihan
Kerugian pelatihan YOLO11 adalah penjumlahan tertimbang dari kerugian CIoU (Complete IoU) untuk regresi kotak, kerugian DFL untuk distribusi koordinat, dan kerugian BCE (binary cross-entropy) untuk klasifikasi.
Kerugian CIoU mengevaluasi tidak hanya IoU (rasio tumpang tindih), tetapi juga jarak antara pusat kotak dan seberapa dekat rasio aspeknya cocok.
\rho(b, b^{gt}) adalah jarak Euclidean antara pusat kotak prediksi dan pusat kotak sebenarnya, c adalah panjang diagonal persegi panjang terkecil yang melingkupi kedua kotak, v mewakili ketidaksesuaian rasio aspek, dan \alpha adalah koefisien yang memberikan bobot lebih besar pada v seiring meningkatnya IoU. Mengoptimalkan IoU saja hampir tidak memberikan gradien ketika kotak tidak tumpang tindih; istilah jarak pusat dan rasio aspek mengurangi masalah ini.
Pelatihan menggunakan augmentasi termasuk Mosaic, yang menggabungkan beberapa gambar; MixUp, yang memadukan dua gambar; Copy-Paste, yang menempelkan wilayah objek ke gambar lain; RandAugment, yang secara otomatis memilih transformasi acak; dan Erasing, yang menghapus wilayah persegi panjang acak. Detail-detail ini mengikuti deskripsi dalam “YOLOv11 Demystified” (arXiv:2604.03349).
7. Membandingkan varian model
YOLO11 tersedia dalam lima ukuran dengan jumlah parameter dan kebutuhan komputasi yang berbeda: n (nano), s (kecil), m (sedang), l (besar), dan x (ekstra besar). Berikut adalah nilai benchmark yang dilaporkan dalam dokumentasi resmi Ultralytics pada COCO val2017 dengan input 640 px.
| Model | mAP50-95 | Parameter | FLOPs | Inferensi CPU ONNX | Inferensi T4 TensorRT |
|---|---|---|---|---|---|
| YOLO11n | 39,5 | 2,6M | 6,5B | 56,1 ± 0,8 ms | 1,5 ± 0,0 ms |
| YOLO11s | 47,0 | 9,4M | 21,6B | 90,0 ± 1,2 ms | 2,5 ± 0,0 ms |
| YOLO11m | 51,5 | 20,1M | 68,1B | 183,2 ± 2,0 ms | 4,7 ± 0,1 ms |
| YOLO11l | 53,4 | 25,3M | 87,2B | 238,6 ± 1,4 ms | 6,2 ± 0,1 ms |
| YOLO11x | 54,7 | 56,9M | 195,3B | 462,8 ± 6,7 ms | 11,3 ± 0,2 ms |
Sumber: Dokumentasi resmi Ultralytics YOLO11. Inferensi CPU ONNX menggunakan ONNX Runtime; inferensi T4 TensorRT adalah FP16 pada GPU NVIDIA T4.
Dua poin praktis menonjol. Pertama, jumlah parameter meningkat sekitar 22 kali lipat dari n ke x, sementara mAP50-95 hanya meningkat sekitar 15 poin, dari 39,5 menjadi 54,7: akurasi dan ukuran model tidak berhubungan secara linier. Kedua, pertimbangkan kesenjangan antara m dan l. Parameter hanya meningkat dari 20,1 juta menjadi 25,3 juta, sementara mAP meningkat dari 51,5 menjadi 53,4 dan waktu inferensi GPU dari 4,7 ms menjadi 6,2 ms. Oleh karena itu, pengembalian dari perpindahan dari m ke l agak lebih kecil daripada pada langkah n → s → m. Angka-angka ini mendukung n/s untuk penerapan di tepi jaringan dan l/x untuk sistem tetap di mana akurasi menjadi prioritas.
Perbandingan kuantitatif dengan YOLOv8
Menempatkan nilai YOLOv8 yang dilaporkan dalam dokumentasi Ultralytics yang sama di samping YOLO11 membuat perubahan generasi menjadi lebih konkret.
| Model | mAP50-95 (v8 → v11) | Parameter (v8 → v11) | FLOPs (v8 → v11) | Inferensi CPU ONNX (v8 → v11) |
|---|---|---|---|---|
| n | 37,3 → 39,5 | 3,2M → 2,6M | 8,7B → 6,5B | 80,4 mdtk → 56,1 mdtk |
| s | 44,9 → 47,0 | 11,2 juta → 9,4 juta | 28.6B → 21.6B | 128,4 mdtk → 90,0 mdtk |
| m | 50,2 → 51,5 | 25,9 juta → 20,1 juta | 78,9B → 68,1B | 234,7 md → 183,2 md |
| aku | 52,9 → 53,4 | 43,7 juta → 25,3 juta | 165.1B → 87.2B | 375.2ms → 238.6ms |
| x | 53.9 → 54.7 | 68.2M → 56.9M | 257.8B → 195.3B | 479.1ms → 462.8ms |
Sumber: Dokumentasi resmi YOLOv8 dan Dokumentasi resmi YOLO11 (COCO val2017, 640 px, inferensi CPU ONNX untuk keduanya).
Untuk ukuran l, jumlah parameter turun dari 43.7M menjadi 25.3M, hampir setengahnya, sementara mAP sedikit meningkat. Di sinilah efek efisiensi parameter C3k2 dan C2PSA paling terlihat. Untuk x, parameter dan FLOPs turun secara substansial, tetapi waktu inferensi CPU hanya sedikit meningkat, menunjukkan bahwa komputasi self-attention dalam C2PSA dapat menjadi hambatan untuk model besar.
Singkatnya, YOLO11 bergeser ke arah pencapaian setidaknya mAP yang sebanding dengan parameter dan FLOPs yang lebih sedikit daripada YOLOv8. Itu tidak berarti selalu mengalahkan YOLOv8: tergantung pada tugas dan dataset, generasi yang lebih lama masih dapat melaporkan akurasi absolut yang lebih tinggi. Artikel tren deteksi objek juga membahas poin ini.
Memperluas YOLO11 di luar deteksi
YOLO11 tidak terbatas pada deteksi objek. Dengan hanya mengganti bagian kepala sambil mempertahankan tulang punggung dan leher yang sama, kerangka kerja ini mencakup segmentasi instans (YOLO11-seg), estimasi pose (YOLO11-pose, yang meregresikan koordinat titik kunci), klasifikasi (YOLO11-cls), deteksi kotak pembatas berorientasi (YOLO11-obb, yang juga meregresikan orientasi objek miring), dan pelacakan di beberapa frame. Karena C3k2 dan C2PSA meningkatkan tulang punggung, manfaatnya dibagi di seluruh tugas ini. Ini juga menunjukkan bahwa YOLO11 dirancang sebagai fondasi pengenalan visual umum daripada hanya model deteksi.
8. Kelemahan yang dihadapinya
YOLO11 mempertahankan kelemahan yang umum pada keluarga YOLO. Objek kecil dan jauh tetap sulit. Karena tulang punggung secara bertahap mengurangi resolusi, objek yang hanya beberapa piksel lebarnya dapat kehilangan hampir semua fitur khasnya pada saat mencapai lapisan yang lebih dalam. C2PSA sebagian mengurangi hal ini, tetapi tidak menyelesaikannya secara fundamental.
Adegan padat dengan banyak objek serupa juga merupakan tantangan. DFL dan CIoU meningkatkan regresi batas, tetapi objek yang berdekatan yang batasnya tumpang tindih, seperti kerumunan atau buah-buahan yang padat di kebun, masih dapat menghasilkan deteksi palsu dan kesalahan deteksi.
Sensitivitas terhadap pergeseran domain adalah masalah umum untuk detektor berbasis CNN. Akurasi dapat menurun tajam di bawah pencahayaan, cuaca, atau sudut kamera yang berbeda secara substansial dari data pelatihan. C2PSA tidak menyediakan bidang reseptif seluas keluarga DETR berbasis Transformer, sehingga YOLO11 mungkin kurang tangguh dalam hal ini.
YOLO11 juga dirilis di bawah lisensi AGPL-3.0. Jika penerapan komersial memerlukan kerahasiaan kode sumber, Lisensi Perusahaan Ultralytics diperlukan. Ini bukan kelemahan teknis, tetapi merupakan kendala praktis yang mudah diabaikan.
9. Cara Memilihnya dalam Praktik
Untuk perangkat edge dan robot bertenaga baterai, kecepatan inferensi dan jumlah parameter biasanya menjadi kendala, menjadikan YOLO11n/s sebagai kandidat pertama. Inferensi CPU model n yang sekitar 56 ms dapat membuat pengoperasian pada perangkat keras tertanam kelas Raspberry Pi menjadi realistis, tergantung pada bagian sistem lainnya.
Untuk inspeksi udara dari drone dan platform bergerak lainnya, deteksi objek kecil sangat penting. Alih-alih hanya memilih model YOLO11 yang lebih besar, tingkatkan resolusi input atau gunakan inferensi ubin. Beberapa laporan memberikan keunggulan pada varian DETR perhatian deformabel di area ini, sehingga RT-DETR dan keluarga lainnya merupakan perbandingan yang wajar ketika akurasi menjadi prioritas.
Untuk inspeksi dengan kamera gudang atau pabrik tetap, YOLO11l/x adalah pilihan ketika sumber daya GPU tersedia dan akurasi menjadi prioritas. Bahkan di sini, detektor berbasis Transformer seperti RF-DETR telah melaporkan lebih dari 60 mAP pada COCO, sehingga YOLO bukan lagi satu-satunya pilihan. Lihat artikel tren deteksi objek untuk detailnya.
Untuk penelitian dan pembuatan prototipe, kematangan paket Python Ultralytics merupakan alasan praktis untuk memilih YOLO11: pelatihan, inferensi, dan ekspor dapat diekspresikan dalam beberapa baris. Di mana batasan lisensinya dapat diterima, kecepatan mendapatkan baseline yang berfungsi tetap menjadi kekuatan utama.
10. Ringkasan tiga baris
-
YOLO11 mempertahankan kerangka tulang punggung–leher–kepala YOLOv8, mengganti blok dasarnya dengan C3k2, dan menambahkan perhatian spasial melalui C2PSA.
-
Kepala tanpa jangkar memprediksi jarak batas sebagai nilai harapan distribusi DFL, sementara CIoU secara bersamaan mengoptimalkan tumpang tindih, jarak pusat, dan rasio aspek.
-
Efisiensi parameter meningkat dari n ke x, tetapi objek kecil, adegan padat, dan pergeseran domain tetap menjadi tantangan umum bagi detektor keluarga YOLO.
Untuk pengantar yang lebih mendasar tentang deteksi objek dan segmentasi semantik, lihat Deteksi Objek dan Segmentasi Semantik: Sebuah Pengantar. Untuk tren terkini di seluruh keluarga YOLO, termasuk pendekatan bebas NMS dan persaingan dari model DETR, lihat artikel tren deteksi objek.
Referensi
- Dokumentasi resmi Ultralytics YOLO11
- Ultralytics: Panduan arsitektur YOLO
- Ultralytics: Manfaat YOLO11 sebagai detektor tanpa anchor
- Konfigurasi model resmi YOLO11 (GitHub)
- YOLOv11 Demystified: Panduan Praktis untuk Deteksi Objek Berkinerja Tinggi (arXiv:2604.03349)
- Generalized Focal Loss: Pembelajaran Kotak Pembatas yang Berkualifikasi dan Terdistribusi untuk Deteksi Objek Padat (NeurIPS 2020, arXiv:2006.04388) )
- Lisensi Ultralytics
Apakah skor deteksi yang tinggi menjamin posisi dan kelasnya benar?
Skor adalah output model, bukan jaminan kebenaran. Evaluasi presisi dan recall pada ambang batas yang berbeda secara terpisah dari akurasi lokalisasi kotak yang terdeteksi.
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.