Contents — find the section you need

Untuk menilai apakah dua tempat dalam sebuah gambar menunjukkan hal yang sama, lebih efisien untuk membandingkan petunjuk kecil yang dapat ditemukan secara berulang daripada membandingkan seluruh gambar. Proses pemilihan petunjuk tersebut disebut deteksi fitur. Proses ini berada di titik awal setiap proses yang membutuhkan kesesuaian antar gambar — estimasi gerakan kamera, penyambungan panorama, rekonstruksi 3D, pengambilan gambar, inspeksi visual. Artikel ini memisahkan "di mana harus memilih" dari "bagaimana mencocokkan titik-titik yang dipilih," dan mengatur pemikiran di balik algoritma klasik dari sudut pandang persamaan dan implementasi.

Kamera kedalaman Intel RealSense D435 dipasang pada tripodIntel RealSense D435

Gambar: Intel Kamera kedalaman RealSense D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons. Kamera representatif, bukan perangkat deteksi fitur saja.

Ringkasan 30 Detik

  • Tempatkan titik fitur bukan pada dinding datar tetapi di sudut dengan perubahan intensitas dalam berbagai arah, atau pada gumpalan yang kecerahannya berbeda dari sekitarnya. Deteksi ulang di tempat yang sama setelah transformasi gambar kecil (pengulangan) adalah yang penting.

  • Deteksi sudut menangkap arah dua arah gradien lokal; deteksi gumpalan menangkap bercak kecerahan yang berbeda secara lokal pada skala tertentu. DoG dengan cepat mencari kandidat gumpalan dari perbedaan beberapa gambar yang dikaburkan.

  • FAST menilai sudut dengan cepat hanya dengan membandingkan piksel pada lingkaran. ORB menggabungkan FAST dengan piramida gambar, estimasi orientasi, dan deskriptor biner BRIEF yang diputar, sesuai untuk penggunaan waktu nyata.

  • SIFT memilih skala melalui DoG, menormalkan orientasi dengan histogram arah gradien, dan membangun deskriptor 128 dimensi. Biaya komputasi dan memori meningkat, tetapi tahan terhadap perubahan skala dan rotasi.

  • Deteksi saja tidak menentukan korespondensi. Jarak deskriptor, uji rasio, dan verifikasi geometris berbasis RANSAC harus dievaluasi bersama sebagai satu alur kerja. Baru-baru ini, deteksi dan pencocokan berbasis pembelajaran seperti SuperPoint, ALIKED, dan LightGlue juga menjadi praktis.

Apa Itu Titik Fitur — Bukan "Titik yang Menonjol" tetapi "Titik yang Dapat Anda Temukan Lagi"

Misalkan koordinat pikselnya adalah \mathbf{x}=(x,y)^\mathsf{T} dan gambarnya I(\mathbf{x}). Titik fitur adalah lokasi yang patch di sekitarnya dapat dideteksi secara stabil sebagai lokasi fisik yang sama bahkan setelah sedikit translasi, rotasi, atau penskalaan, dan yang dapat dibedakan dari titik-titik lain berdasarkan pola di sekitarnya. Yang pertama disebut detektor, dan apa pun yang mengubah yang terakhir menjadi vektor numerik atau string bit disebut deskriptor.

Keduanya berbeda. FAST, pada prinsipnya, adalah detektor; BRIEF adalah deskriptor; ORB adalah mekanisme yang menggabungkan keduanya. SIFT adalah kombinasi dari detektor DoG dan deskriptor histogram gradien. Membandingkan nama saja akan menimbulkan kebingungan, jadi mulai sekarang kita selalu memperlakukan ini sebagai tiga tahap: "memilih titik," "merepresentasikan lingkungan sekitar," dan "mencocokkan titik."

Diagram 1 · Use the button to switch views
The flow of feature-based matchingDiagram showing feature points and descriptors extracted from two images, candidate correspondences geometrically verified with RANSAC, to obtain reliable correspondences. Image AInput frameDetect + describekeypoints / descriptorsScale and orientation stored tooCandidate matchingDistance, ratio testGeometric verificationRANSACCorrespondence / poseThe same extraction runs on Image B too

Gambar: dibuat oleh Duskcoil. Kualitas sistem diatur bukan oleh jumlah deteksi, tetapi oleh jumlah korespondensi yang akhirnya konsisten secara geometris.

Sudut: Memilih Tempat yang Berubah dalam Dua Arah

Fitur yang paling intuitif adalah sudut. Tuliskan perubahan yang tampak ketika sebuah patch gambar W digeser dengan perpindahan kecil \mathbf{u}=(u,v)^\mathsf{T} sebagai SSD (jumlah selisih kuadrat):

E(\mathbf{u})=\sum_{\mathbf{x}\in W} w(\mathbf{x})\left[I(\mathbf{x}+\mathbf{u})-I(\mathbf{x})\right]^2 \simeq \mathbf{u}^{\mathsf{T}}\mathbf{M}\mathbf{u}

Di bawah aproksimasi Taylor orde pertama, matriks struktur lokal (momen kedua) \mathbf{M} menjadi

\mathbf{M}=\sum_{\mathbf{x}\in W}w(\mathbf{x}) \begin{bmatrix}I_x^2&I_xI_y\\I_xI_y&I_y^2\end{bmatrix}

di mana I_x,I_y adalah gradien gambar dan w adalah bobot seperti jendela Gaussian. Misalkan nilai eigen \mathbf{M} adalah \lambda_1,\lambda_2 ; sebuah titik adalah sudut di mana bahkan nilai eigen yang lebih kecil pun besar. Di tepi, di mana gradien besar hanya dalam satu arah, satu nilai eigen tetap kecil. Di daerah datar, keduanya tetap kecil. Detektor Harris tidak secara eksplisit menghitung nilai eigen di setiap piksel; sebaliknya, ia memilih nilai maksimum lokal dari nilai respons berikut:

R=\det(\mathbf{M})-k\,\mathrm{trace}(\mathbf{M})^2 =\lambda_1\lambda_2-k(\lambda_1+\lambda_2)^2

k biasanya sekitar 0,04–0,06. Harris relatif kuat terhadap rotasi, tetapi karena ia melihat melalui jendela berukuran tetap, ia tidak memiliki mekanisme untuk memilih titik yang sama ketika subjek diperbesar atau diperkecil secara signifikan. \min(\lambda_1,\lambda_2) Shi–Tomasi juga banyak digunakan sebagai kriteria praktis untuk memilih sudut yang sesuai untuk pelacakan.

Gumpalan: Sebuah "Gumpalan," Bahkan Tanpa Sudut, Merupakan Petunjuk yang Berguna

Sudut saja tidak cukup untuk menangkap logo bulat, bintik-bintik, lubang gelap, atau pusat pantulan terang. Jadi, detektor gumpalan menemukan bercak kecerahan yang berbeda secara lokal relatif terhadap sekitarnya, pada skala tertentu. Tuliskan ruang skala yang dihaluskan dengan Gaussian G(\mathbf{x};\sigma) sebagai

L(\mathbf{x};\sigma)=G(\mathbf{x};\sigma)*I(\mathbf{x})

di mana * adalah konvolusi dan \sigma mewakili "ukuran yang kita lihat." Respons yang dinormalisasi skala dari Laplacian of Gaussian (LoG),

\sigma^2\nabla^2L=\sigma^2(L_{xx}+L_{yy})

merespons dengan kuat terhadap lingkaran gelap pada latar belakang terang, atau lingkaran terang pada latar belakang gelap. Menemukan ekstremum tidak hanya pada posisi tetapi juga pada ruang tiga dimensi (x,y,\sigma) termasuk arah \sigma secara bersamaan memilih pusat dan ukuran karakteristik suatu blob. Anda juga dapat menginterpretasikan ini sebagai skala yang sesuai dengan blob melingkar yang jari-jarinya kira-kira \sqrt{2}\sigma.

LoG adalah ide yang bagus, tetapi menghitung turunan kedua yang tepat pada setiap skala itu mahal. Aproksimasi dan percepatan ini mengarah ke DoG, dan dari sana ke SIFT.

DoG: Menemukan Kandidat Invarian Skala dari Perbedaan Pengaburan

Perbedaan Gaussian (DoG) adalah perbedaan antara dua gambar yang berdekatan dan telah dikaburkan:

D(\mathbf{x};\sigma)=L(\mathbf{x};k\sigma)-L(\mathbf{x};\sigma)

di mana k>1 adalah rasio antara skala yang berdekatan. Hingga faktor konstan, DoG mendekati LoG yang dinormalisasi skala, sehingga kandidat blob dapat dicari hanya dengan satu konvolusi tambahan. Dalam implementasinya, Anda membangun piramida Gaussian dengan mengaburkan gambar secara bertahap, dan membandingkan setiap piksel DoG dengan 8 tetangganya pada skala yang sama ditambah 9 tetangga masing-masing pada skala di atas dan di bawahnya — total 26. Nilai maksimum atau minimum menjadikannya kandidat.

Kandidat tidak digunakan apa adanya. Ekstremum yang lemah adalah noise dan ditolak, begitu pula ekstremum di sepanjang tepi yang memanjang. Interpolasi kuadrat 3D di sekitar ekstremum DoG memberikan posisi dan skala subpiksel. Untuk Hessian

\mathbf{H}=\begin{bmatrix}D_{xx}&D_{xy}\\D_{xy}&D_{yy}\end{bmatrix}

nilai \mathrm{Tr}(\mathbf{H})^2/\det(\mathbf{H}) yang besar menunjukkan Respons tepi di mana hanya satu kelengkungan utama yang kuat, dan titik-titik tersebut dikecualikan. Ini mengatasi masalah yang sama seperti pada deteksi sudut: sebuah titik pada tepi terlihat serupa bahkan ketika digeser sepanjang tepi, sehingga korespondensinya tidak dapat ditentukan secara unik.

FAST: Menilai Sudut dengan Cepat Hanya dengan Melihat Lingkaran

Features from Accelerated Segment Test (FAST) menggunakan 16 piksel pada lingkaran Bresenham radius-3 di sekitar piksel p. Dengan ambang batas t, jika n piksel berurutan (biasanya 9 atau 12) semuanya lebih terang daripada I_p+t, atau semuanya lebih gelap daripada I_p-t, p dinilai sebagai sudut.

\exists\,S_n:\quad \forall q\in S_n,\quad I_q>I_p+t\quad\text{or}\quad I_q<I_p-t

Karena tidak menghitung gradien atau matriks — hanya sejumlah kecil perbandingan piksel ditambah penolakan awal — Ini sangat cepat. Desain yang pertama-tama memeriksa piksel pada posisi jam 1, 5, 9, dan 13 pada lingkaran, dan segera berhenti jika rangkaian piksel terang/gelap yang berkelanjutan tidak mungkin terbentuk, adalah kunci kecepatannya. Di sisi lain, FAST biasa tidak menyediakan skala maupun orientasi, dan cenderung merespons banyak titik di sepanjang tepi. Hanya setelah menghitung perbedaan intensitas dari sekitarnya, menerapkan penekanan non-maksimum (NMS), dan menggabungkannya dengan piramida gambar barulah ia menjadi detektor multi-skala yang praktis.

ORB: Tidak Meninggalkan FAST sebagai "Cepat tetapi Sulit Digunakan"

ORB (Oriented FAST and Rotated BRIEF) adalah konstruksi yang memperkuat FAST dan BRIEF, yang ditujukan untuk pencocokan gambar waktu nyata. Pertama, ia menjalankan FAST di seluruh piramida gambar pada setiap rasio reduksi s, mempertahankan titik-titik teratas dari setiap level. Ini memberikan, jika tidak tepat, ketahanan terhadap perubahan skala.

Selanjutnya, ia menghitung pusat intensitas dari patch di sekitar titik p . Dari momen

m_{pq}=\sum_{x,y}x^py^q I(x,y),\qquad \mathbf{c}=\left(\frac{m_{10}}{m_{00}},\frac{m_{01}}{m_{00}}\right)

sudut \theta=\operatorname{atan2}(m_{01},m_{10}) dari pusat p ke titik pusat \mathbf{c} menjadi orientasi dominan. Deskriptor BRIEF adalah string bit yang membandingkan pasangan piksel (\mathbf{a}_i,\mathbf{b}_i) di dalam patch:

\tau_i=\begin{cases}1&I(\mathbf{a}_i)<I(\mathbf{b}_i)\\0&\text{otherwise}\end{cases}

ditata kira-kira 256 kali. Dalam ORB, koordinat pasangan titik diputar sebesar \theta sebelum perbandingan, sehingga pola bit yang sama cenderung dihasilkan bahkan setelah rotasi. rBRIEF, yang belajar untuk memilih pasangan perbandingan dengan korelasi rendah, adalah cara lain untuk mempertahankan konten informasi bit. Jarak antara string biner dapat dihitung dengan cepat sebagai jarak Hamming — jumlah bit yang diatur setelah XOR.

Kekuatan ORB adalah kecepatan dan efisiensi memori pada CPU dan perangkat tertanam, dan itu Digunakan secara luas dalam Visual SLAM. Namun, dalam perbedaan skala yang besar, blur yang berat, atau perubahan sudut pandang yang signifikan, SIFT atau fitur berbasis pembelajaran dengan deskripsi gradien yang lebih kaya dapat menguntungkan.

SIFT: Menormalisasi Skala, Orientasi, dan Deskripsi Secara Konsisten

Transformasi Fitur Invarian Skala (SIFT) mendeteksi ekstremum (x,y,\sigma) melalui DoG, dan menghilangkan titik-titik kontras rendah dan respons tepi. Di sekitar lingkungan setiap titik, ia menghitung besaran dan arah gradien, dan membangun histogram orientasi berbobot Gaussian. Puncak terbesar menjadi orientasi dominan yang digunakan untuk menormalisasi rotasi patch, dan puncak sekunder yang melebihi 80% dari maksimum juga diberi orientasi sendiri. Inilah inti dari ketahanannya terhadap rotasi.

Untuk deskriptor, jendela yang dinormalisasi sekitar 16\times16 dibagi menjadi 4\times4 sel, dan setiap sel mendapatkan histogram gradien 8 arah. Oleh karena itu, dimensinya adalah 4\times4\times8=128 . Vektor \mathbf{d} dinormalisasi L2, dan elemen yang melebihi 0,2 dipotong dan dinormalisasi ulang, sehingga menekan sensitivitas terhadap perubahan pencahayaan lokal.

\hat{\mathbf{d}}=\frac{\mathbf{d}}{\|\mathbf{d}\|_2},\qquad d_i\leftarrow\min(\hat d_i,0.2),\qquad \mathbf{d}\leftarrow\frac{\mathbf{d}}{\|\mathbf{d}\|_2}

Dengan kata lain, "invariansi" SIFT bukanlah sihir. Ini adalah desain eksplisit yang menangani setiap sumber variasi secara individual: memilih skala melalui piramida gambar, memutar kerangka koordinat berdasarkan orientasi dominan, dan menyerap kontras melalui normalisasi. Ini tidak sepenuhnya efektif terhadap deformasi affin atau perbedaan sudut pandang yang besar, yang masih memerlukan RANSAC atau geometri multi-pandangan di tahap selanjutnya.

Pseudokode Implementasi Minimal

Pemrosesan titik fitur tidak boleh berhenti pada ekstraksi — harus diimplementasikan hingga verifikasi korespondensi. Berikut adalah kerangka yang berlaku untuk ORB atau SIFT.

function match_images(imageA, imageB, method):
    grayA, grayB = to_gray(imageA), to_gray(imageB)
    detector = create(method)        # ORB: FAST+pyramid+rBRIEF / SIFT: DoG+gradient
    keyA, descA = detector.detect_and_compute(grayA)
    keyB, descB = detector.detect_and_compute(grayB)

    metric = HAMMING if method == ORB else L2
    tentative = []
    for each descriptor a in descA:
        b1, b2 = two_nearest(a, descB, metric)
        if distance(a, b1) < 0.75 * distance(a, b2):
            tentative.append((a.keypoint, b1.keypoint))

    H, inlier_mask = RANSAC_HOMOGRAPHY(tentative, reproj_threshold=3px)
    return tentative[inlier_mask], H

Mengambil hanya satu tetangga terdekat akan meninggalkan titik-titik ambigu, seperti bingkai jendela, grid, dan pola berulang, di dalam Hasilnya. Uji rasio Lowe menggunakan rasio jarak terbaik d_1 terhadap jarak terbaik kedua d_2, dengan membuang kandidat yang selisihnya dengan kandidat kedua tidak cukup besar. RANSAC kemudian memperkirakan homografi \mathbf{H} atau matriks fundamental dari subset korespondensi acak kecil sebagai hipotesis, dan memilih hipotesis yang menjelaskan korespondensi terbanyak (inlier) dengan kesalahan reproyeksi kecil. Jika objeknya planar, atau kamera hanya diputar di tempat, konsistensi dapat diperiksa dengan homografi.

\tilde{\mathbf{x}}'\sim\mathbf{H}\tilde{\mathbf{x}}

Untuk adegan 3D umum, matriks fundamental/esensial digunakan sebagai gantinya. Jumlah dan rasio inlier yang bertahan hingga titik ini adalah jumlah fitur yang benar-benar dapat digunakan.

Apa yang Tahan terhadap Pencahayaan, Skala, dan Rotasi, dan Sejauh Mana

Terhadap perubahan pencahayaan, offset kecerahan sederhana I'(x,y)=I(x,y)+b menghancurkan perbedaan piksel, Namun, hal ini memiliki sedikit pengaruh pada hubungan relatif dalam gradien atau perbandingan biner. Perubahan kontras seragam I'=aI+b juga ditangani dengan cukup baik oleh normalisasi deskriptor SIFT. Tetapi ketika struktur lokal itu sendiri berubah — saturasi eksposur, batas bayangan, refleksi, siang versus malam — metode klasik saja tidak memberikan jaminan. Selama pengambilan gambar, perbaiki atau kelola eksposur dengan ketat, dan jika perlu, terapkan koreksi kontras lokal seperti CLAHE dalam kondisi yang sama untuk kedua gambar. Koreksi berlebihan berisiko mengubah noise menjadi fitur palsu, jadi berhati-hatilah.

Harris atau FAST resolusi tunggal secara inheren lemah terhadap perubahan skala. ORB, yang mencari kandidat di seluruh piramida gambar, memiliki toleransi praktis, meskipun tidak memiliki normalisasi yang sama dengan SIFT, yang memilih ekstremum skala kontinu melalui DoG. Jika tekstur menghilang pada skala yang dikurangi, tidak ada metode yang dapat menemukan korespondensi. Resolusi input, kedalaman piramida, dan ukuran patch minimum harus ditentukan dari rentang variasi jarak pengambilan gambar yang diharapkan.

Terhadap rotasi, respons Harris itu sendiri relatif stabil, tetapi pencocokan membutuhkan rotasi kerangka koordinat deskriptor. ORB menetapkan orientasi melalui centroid intensitas, SIFT melalui histogram arah gradien. Normalisasi sudut kontinu seperti itu lebih efektif daripada deskriptor yang hanya menangani langkah rotasi 90 derajat. Sementara itu, tampilan miring yang kuat bukanlah rotasi dan penskalaan tetapi deformasi affin/proyektif, yang membutuhkan data multi-view, fitur kovarian affin, atau fitur berbasis pembelajaran yang dikombinasikan dengan verifikasi geometris.

Metrik Evaluasi: Ukur Korespondensi yang Dapat Digunakan, Bukan Jumlah Titik

Untuk pasangan gambar dengan homografi yang diketahui H, proyeksikan titik \mathbf{x}_i dari gambar A ke B, dan jika titik dalam jarak \epsilon ada dalam himpunan titik yang terdeteksi K_B, hitung sebagai deteksi ulang yang berhasil. Pengulangan secara konseptual

\mathrm{Repeatability}=\frac{\#\{\mathbf{x}_i\in K_A: \min_{\mathbf{y}\in K_B}\|H\mathbf{x}_i-\mathbf{y}\|<\epsilon\}}{\min(|K_A|,|K_B|)}

Tetapi menemukan lokasi yang sama tidak berguna jika deskriptornya tidak dapat membedakannya. Jadi Anda juga melaporkan presisi pencocokan (fraksi korespondensi yang benar), jumlah korespondensi yang benar, rasio inlier pasca-RANSAC, kesalahan rotasi/translasi dari pose yang diperkirakan, waktu pemrosesan, dan memori. HPatches adalah benchmark representatif yang memisahkan perubahan pencahayaan dari perubahan sudut pandang untuk mengevaluasi pencocokan patch, detektor, dan estimasi homografi. Kecuali Anda mengukur dengan data yang sesuai dengan geometri aplikasi Anda (planar, atau 3D garis dasar lebar), Anda tidak boleh mengadopsi peringkat skor tunggal apa adanya.

Metode Inti deteksi Deskriptor Skala/rotasi Jarak pencocokan Kekuatan Peringatan utama
Harris + patch Matriks struktur Patch mentah, dll. Skala ✕, rotasi terpisah SSD/NCC Prinsip yang jelas Lemah terhadap pencahayaan/skala
LoG / DoG Ekstrema blob ruang-skala Membutuhkan deskriptor terpisah Skala ◎, rotasi terpisah Bergantung pada deskriptor Mendapatkan blob dan skala Komputasi piramida diperlukan
CEPAT + RINGKAS Kecerahan kontinu pada lingkaran Perbandingan biner Tidak keduanya sendiri Hamming Sangat cepat Lemah terhadap sudut pandang/skala
ORB Piramida CEPAT RINGKAS rBERPUTAR Skala ○, rotasi ○ Hamming Ringan, ramah waktu nyata Terbatas di bawah deformasi besar
SIFT Ekstrema DoG Histogram gradien 128 dimensi Skala ◎, rotasi ◎ L2 Kokoh, tervalidasi dengan baik Memakan banyak CPU/memori
Berbasis pembelajaran Dipelajari melalui jaringan Vektor yang dipelajari Diperkuat melalui data L2 / dipelajari Tingkat korespondensi tinggi dalam kondisi sulit Membutuhkan model, GPU, Manajemen Reproduksibilitas

Tanda ○ dan ◎ pada tabel bukanlah peringkat absolut — melainkan tolok ukur relatif untuk implementasi tipikal dan rentang yang diharapkan. Bahkan SIFT pun ambigu ketika pola grid yang sama mengisi frame, dan bahkan ORB dapat memperoleh cukup banyak inlier dalam kondisi sedang.

Posisi Ini dalam Pustaka Saat Ini dan Produk Nyata

Untuk prototipe pertama, cv::ORB::create(), cv::SIFT::create(), dan cv::FastFeatureDetector::create() dari OpenCV mudah digunakan. ORB dipasangkan dengan BFMatcher(NORM_HAMMING); SIFT dengan jarak L2 BFMatcher atau pencocok berbasis FLANN. Bahkan jika Anda menginginkan detektor dan deskriptor terpisah, API Feature2D OpenCV membuat Anda tetap berada dalam alur yang sama. Untuk eksperimen berbasis pembelajaran dan pemrosesan GPU, Kornia di PyTorch menyediakan SIFT, ORB, DISK, KeyNet/HardNet, LightGlue, dan banyak lagi sebagai blok bangunan.

Dalam praktik fotogrametri dan rekonstruksi 3D, COLMAP adalah alat yang representatif; dokumentasi resminya saat ini mendukung SIFT standar ditambah ALIKED ketika dibangun dengan ONNX diaktifkan. Karena SIFT dan ALIKED dapat terhubung ke pencocokan brute-force atau pencocokan LightGlue, mudah untuk membandingkan pendekatan klasik dan berbasis pembelajaran pada titik masuk rekonstruksi. Saat memilih produk atau pustaka, lebih baik untuk terlebih dahulu memutuskan apakah produk atau pustaka tersebut harus berjalan hanya dengan CPU, anggaran latensi, apakah pencocokan offline yang berat dapat diterima, dan apakah diperlukan penguncian versi yang dapat direproduksi — daripada apakah nama modelnya terdengar baru.

Penelitian Terbaru: Mengoptimalkan Deteksi, Deskripsi, dan Pencocokan Secara Bersamaan

Salah satu titik balik untuk pendekatan berbasis pembelajaran adalah SuperPoint. Jaringan konvolusional penuh menghasilkan peta probabilitas titik minat dan peta deskriptor sekaligus, belajar secara mandiri, melalui Adaptasi Homografik, untuk mereproduksi titik-titik di seluruh transformasi geometris. Ini adalah gagasan belajar dari data di mana lokasi yang berguna untuk korespondensi berada, daripada mengandalkan sepenuhnya pada gagasan "keterbatasan sudut" yang dirancang secara manual.

DISK mengatasi masalah bahwa pemilihan titik-titik jarang dan pencocokannya bersifat diskrit dan sulit dibedakan, dengan mengoptimalkan deteksi dan deskripsi ujung-ke-ujung dengan gradien kebijakan yang memberi penghargaan pada jumlah korespondensi yang benar. ALIKED menggunakan Sparse Deformable Descriptor Head yang mempelajari lokasi dukungan deformabel di sekitar setiap titik kunci, bertujuan untuk menyeimbangkan ekspresivitas dan efisiensi dengan mengekstrak deskriptor pada titik-titik jarang daripada dari seluruh peta fitur padat.

Pencocok juga bergeser dari pencarian tetangga terdekat independen. LightGlue memperkirakan korespondensi antara dua set fitur lokal menggunakan mekanisme perhatian, dengan komputasi adaptif yang berhenti lebih awal ketika pasangan gambar mudah. Ini bukan detektor fitur itu sendiri, tetapi ini merupakan pengingat penting bahwa jarak deskriptor yang baik dari detektor saja tidak menjamin korespondensi akhir yang baik. Saat ini, praktis untuk membandingkan pengaturan yang menggunakan fitur klasik dengan pencocok ringan dengan pengaturan yang mencocokkan fitur yang dipelajari seperti SuperPoint/ALIKED dengan LightGlue, di bawah Pengaturan RANSAC yang identik pada data target Anda.

Daftar Periksa Pemilihan dan Penyetelan

  • Pertama, catat jumlah deteksi, jumlah lulus uji rasio, jumlah inlier RANSAC, rasio inlier, dan waktu pemrosesan pada pasangan gambar nyata. Meningkatkan jumlah deteksi saja dapat menjadi bumerang jika ketidakcocokan meningkat bersamaan dengannya.
  • Untuk pelacakan durasi pendek di dekat kamera tetap, mulailah dengan FAST/ORB dan setel nfeatures, ambang batas FAST, dan level piramida. Di bawah tekstur rendah, periksa blur, eksposur, dan fokus sebelum menurunkan ambang batas.
  • Untuk mencocokkan gambar diam dengan perubahan besar dalam jarak pengambilan atau rotasi, gunakan SIFT sebagai dasar. Apakah metode yang lebih cepat mengalahkan SIFT harus selalu diverifikasi pada data yang sama dengan verifikasi geometris yang sama.
  • Di malam hari, di bawah cahaya latar yang kuat, di tengah perubahan musim, atau dengan perbedaan sudut pandang yang lebar, pertimbangkan juga fitur berbasis pembelajaran. Tetapi sertakan kesenjangan antara data pelatihan dan lingkungan target, pembaruan model, dan ketersediaan GPU dalam evaluasi kinerja.

  • Pola berulang, permukaan spekular, objek bergerak, dan blur gerakan ekstrem kurang menjadi masalah. Masalah deteksi fitur lebih kompleks daripada ambiguitas observasi. Kompensasi dengan masking, pelacakan temporal, fusi sensor, dan perencanaan pengambilan gambar.

Deteksi fitur bukanlah pengklasifikasi serbaguna untuk memahami gambar. Namun, deteksi fitur tetap menjadi teknologi dasar yang efektif untuk memilih, dengan sedikit komputasi, piksel mana yang dapat mendukung geometri. Memahami gagasan tentang sudut, gumpalan, ruang skala, dan normalisasi orientasi memungkinkan Anda untuk melacak penyebab kegagalan di balik angka-angka tersebut, baik Anda sedang menyetel ORB/SIFT klasik atau mengevaluasi fitur berbasis pembelajaran.

Periksa pemahaman Anda
Apakah setiap titik pada tepi yang kuat mudah dilacak?

Gerakan di sepanjang satu tepi bersifat ambigu. Sudut memberikan perubahan intensitas dalam arah yang berbeda, sehingga gerakan dua dimensi lebih mudah diidentifikasi.

Referensi

Putar citra sintetis di Lab ekstraksi fitur dan bandingkan deteksi Harris dengan Shi–Tomasi.

What to read next

Review the backgroundPanduan Kalibrasi Kamera — Memulihkan Distorsi Lensa dan Parameter IntrinsikContinue the seriesLab kecerahan dan luminans — eksposur, gamma, dan clippingExplore another aspect of this fieldLab ekstraksi titik fitur — membandingkan Harris dan Shi–Tomasi