Contents — find the section you need
Deteksi objek adalah tugas memperkirakan lokasi (bounding box) dan kategori suatu objek dari sebuah gambar secara bersamaan. Keluarga YOLO telah lama menjadi pilihan utama untuk penggunaan produksi, tetapi pada tahun 2026, detektor berbasis transformer telah mencapai titik di mana mereka benar-benar mengancam posisi tersebut.
Artikel ini berfokus pada tren penelitian dan secara singkat memperkenalkan konsep-konsep penting terlebih dahulu.
Tidak ditemukan logo resmi bebas lisensi untuk YOLO/Ultralytics, jadi ikon sederhana yang mewakili deteksi bounding-box dibuat sebagai gantinya.
Sekilas tentang Perbedaan Desain Detektor
Diagram: Duskcoil. Ini menyoroti perbedaan desain representatif antara prediksi padat dan prediksi set.
Setiap detektor objek mengubah gambar masukan menjadi fitur dan pada akhirnya mengembalikan lokasi, kategori, dan kepercayaan. Perbedaan utamanya adalah apakah ia membuat banyak kandidat dan menghapus duplikasi setelahnya, atau mencocokkan kueri objek yang dipelajari satu-per-satu dengan kebenaran dasar dan secara langsung memprediksi himpunan dengan duplikasi rendah. Pilihan itu menyebar ke kebutuhan akan NMS, tujuan pelatihan, kecepatan, dan perilaku dalam adegan ramai.
Posisi Keluarga YOLO: Menuju Tanpa NMS
NMS tradisional adalah langkah pasca-pemrosesan yang mempersempit beberapa kotak kandidat yang dihasilkan untuk objek yang sama menjadi satu deteksi akhir, dengan membuang kotak apa pun yang tumpang tindihnya (IoU: Intersection over Union, area tumpang tindih antara dua kotak dibagi dengan area gabungannya) dengan kotak lain melebihi ambang batas.
Pasca-pemrosesan ini berjalan sebagai langkah independen di luar jaringan, dan memiliki konsekuensi: penyetelan empiris tentang di mana harus menetapkan ambang batas, dan kecenderungan untuk secara keliru membuang objek yang benar-benar berbeda dan berdekatan. YOLO26, generasi terbaru YOLO, mengadopsi arsitektur tanpa NMS yang tidak lagi membutuhkan penekanan non-maksimum, langkah pasca-pemrosesan yang telah menjadi standar selama bertahun-tahun. NMS cenderung menjadi hambatan bagi biaya komputasi dan latensi dalam pipeline inferensi, dan penghapusan hambatan tersebut bertujuan untuk meningkatkan kecepatan inferensi dan kesederhanaan implementasi. Dari sisi throughput murni, ujung spektrum yang ringan dan berkecepatan tinggi juga tetap memiliki banyak pilihan — RTMDet, misalnya, mencapai lebih dari 300 FPS.
Kebangkitan Detektor Berbasis Transformer: RF-DETR dan RT-DETRv2
Tren utama lainnya adalah perkembangan DETR (DEtection TRansformer) yang mencapai kematangan praktis. RT-DETR/RT-DETRv2 menggabungkan CNN dengan transformer, dan, seperti keluarga YOLO, dirancang untuk menghasilkan deteksi akhir secara langsung tanpa NMS.
Peristiwa besar tahun 2026 adalah kedatangan RF-DETR, yang dipresentasikan di ICLR 2026. Ini digambarkan sebagai model real-time pertama yang menembus 60 mAP pada benchmark COCO, dan juga memimpin benchmark RF100-VL, yang mengevaluasi transfer domain. Lisensinya adalah Apache 2.0 — Diizinkan untuk penggunaan komersial — berbeda dengan YOLO26/YOLOv12 yang berlisensi AGPL.
Deteksi Kosakata Terbuka melalui Prompt Teks
Tren penting lainnya adalah "deteksi kosakata terbuka" — mendeteksi kategori yang tidak pernah dilatih pada model. YOLO-World dan Grounding DINO dapat mendeteksi kategori sembarang hanya dengan prompt teks, tanpa memerlukan data pelatihan tambahan. Ini merupakan pergeseran pola pikir dari deteksi yang terikat pada daftar kelas tetap, dan sangat cocok untuk kasus penggunaan di mana kategori dunia nyata tidak dapat sepenuhnya diuraikan sebelumnya — misalnya, pengenalan objek untuk robot serbaguna.
Mekanisme Teknis di Balik Penghapusan NMS
Pergeseran YOLO26 ke deteksi bebas NMS bukan hanya masalah melewatkan langkah pasca-pemrosesan — tetapi berasal dari perubahan metode pelatihan itu sendiri. Desain YOLO tradisional mentolerir beberapa kotak prediksi per objek selama pelatihan (penugasan satu-ke-banyak), dengan asumsi bahwa NMS akan mengurangi duplikat setelahnya. Inferensi. YOLO26 mendesain ulang kepala prediksi, beralih ke penugasan satu-ke-satu, di mana satu kotak definitif per instance objek dikeluarkan mulai dari pelatihan itu sendiri. Ia juga menggantikan pendekatan berbasis distribusi yang digunakan untuk regresi bounding-box (Distribution Focal Loss) dengan parameterisasi yang lebih ringan dan ramah perangkat keras, memangkas operasi yang cenderung tidak stabil di berbagai kompiler dan runtime. Hasilnya adalah inferensi hingga 43% lebih cepat pada CPU, bersamaan dengan implementasi pasca-pemrosesan yang lebih sederhana secara keseluruhan.
RF-DETR juga bebas NMS, tetapi dengan mekanisme yang berbeda dari YOLO26. RF-DETR menggunakan Vision Transformer yang telah dilatih sebelumnya, DINOv2, sebagai tulang punggungnya, mengekstrak fitur multi-resolusi, dan meneruskannya melalui decoder yang bekerja dengan query yang dapat dipelajari (representasi abstrak yang mewakili objek kandidat). Setiap lapisan decoder terdiri dari self-attention (menangkap hubungan antar query), deformable cross-attention (hanya memperhatikan sejumlah kecil titik sampel yang dipelajari dalam fitur gambar), dan jaringan feed-forward yang menyempurnakan prediksi. Perhatian deformabel "hanya melihat sejumlah kecil titik yang dipelajari" ini menjaga biaya komputasi lebih rendah daripada perhatian silang transformer standar, sambil menghasilkan prediksi berbasis set yang unik — yang justru menjadi alasan mengapa NMS menjadi tidak perlu sejak awal.
Apa yang Sebenarnya Ditunjukkan Perbandingan Lintas Generasi: YOLOv8/v11/v26
Data juga muncul yang menolak asumsi bahwa "generasi yang lebih baru = akurasi yang seragam lebih tinggi." Sebuah benchmark Agustus 2026 yang mencakup tiga generasi YOLO dan lima skala model — menargetkan struktur halus (cabang, buah, objek kecil lainnya) dalam deteksi kebun dan segmentasi instance — menemukan bahwa mAP@50:95 tertinggi sama sekali bukan ditetapkan oleh YOLOv26, tetapi oleh YOLOv11s-960 (0,402 mask mAP@50:95, 0,426 box mAP@50:95). Sementara itu, YOLOv26s-960 mencapai akurasi yang kurang lebih sebanding hanya dengan 10,37 juta parameter. Jadi gambaran yang muncul adalah: peningkatan akurasi mentah tidak datang secara seragam dengan setiap generasi baru, tetapi efisiensi parameter — mencocokkan akurasi dengan komputasi yang jauh lebih sedikit — terus meningkat.
Deteksi objek kecil juga tetap menjadi tantangan nyata yang belum terselesaikan. Evaluasi Agustus 2026 yang membandingkan enam varian YOLO dan dua varian DETR pada deteksi kendaraan militer menemukan pola yang konsisten: model yang lebih besar berkinerja lebih baik, pendekatan berbasis DETR menunjukkan potensi, dan penyempurnaan meningkatkan kinerja udara-ke-darat (A2G) — tetapi setiap model masih kesulitan mendeteksi objek kecil dalam skenario A2G. Baik desain bebas NMS YOLO26 maupun mAP tinggi RF-DETR belum sepenuhnya memecahkan masalah "objek kecil dan jauh" ini.
Kemajuan Deteksi Kosakata Terbuka: Angka AP Konkret
Generasi detektor kosakata terbuka setelah YOLO-World/Grounding DINO juga telah membuat peningkatan akurasi yang stabil hingga tahun 2026. FlowOVD (Mei 2026), yang Menggunakan alur generatif yang diperbaiki untuk mengubah kueri yang tidak bergantung pada teks menjadi kueri yang dipandu teks, melaporkan 49,5 AP pada COCO dan 31,5 AP pada LVIS — peningkatan +1,2 AP (relatif +2,5%) dan +4,1 AP (relatif +15,0%) dibandingkan Grounding DINO, masing-masing. OPUS, yang diterbitkan pada Agustus 2026, menangani berbagai jenis prompt — teks, visual (interaktif/generik), dan campuran — dalam satu kerangka kerja terpadu, dan meskipun desainnya lebih sederhana yang menghindari fusi lintas modal yang berat, ia mencatatkan angka-angka tingkat canggih sebesar 68,1/69,2/54,7 AP di seluruh benchmark COCO, LVIS-minival, dan ODinW35. Deteksi kosakata terbuka bukan lagi hanya kemenangan kualitatif — kemampuan untuk menangani kategori yang tidak dikenal — tetapi juga mulai menjadi kompetitif secara kuantitatif dengan detektor kelas tetap.
Lanskap pada tahun 2026
Objek Deteksi saat ini sebagian besar dibingkai di sepanjang dua sumbu: arsitektur transformator satu tahap, bebas NMS, dan keluarga YOLO dengan ekosistemnya yang mapan. Sisi transformator berkembang pesat, tetapi keluarga YOLO tetap menjadi tulang punggung lingkungan produksi waktu nyata, berkat rekam jejak produksinya dan kedalaman perangkatnya. Diuraikan berdasarkan kasus penggunaan:
- Akurasi di atas segalanya: RF-DETR
- Rekam jejak dan ekosistem paling penting: YOLO26/YOLOv12
- Kecepatan murni: RTMDet
- Perlu menangani kategori yang tidak diketahui: YOLO-World / Grounding DINO
Itulah pembagian kerja saat ini.
Bisakah mAP saja memilih detektor waktu nyata?
Bandingkan latensi dan kualitas pada resolusi, data, dan perangkat keras yang sesuai. Waktu inferensi tanpa pra- dan Pemrosesan pasca tidak memiliki latensi ujung-ke-ujung.
Referensi
- Mendekonstruksi RF-DETR (Menuju AI)
- Makalah RT-DETRv2 (arXiv)
- Makalah DETR Mengalahkan YOLO dalam Deteksi Objek Real-time (arXiv)
- Model Deteksi Objek Terbaik 2026 (Blog Roboflow)
- YOLO26: Analisis Kerangka Kerja Ujung-ke-Ujung Bebas NMS untuk Deteksi Objek Real-Time (arXiv)
- Makalah RF-DETR (ICLR 2026, arXiv)
- GitHub RF-DETR (roboflow)
- Makalah Optimasi Lintas Generasi YOLOv26, YOLOv11, dan YOLOv8 (arXiv)
- Makalah Studi Perbandingan Teknologi Out-of-the-Box untuk Deteksi dan Pengenalan Target Otomatis (arXiv)
- Makalah FlowOVD (arXiv)
- Makalah OPUS (arXiv)
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.