Contents — find the section you need

Bir görüntüdeki iki noktanın aynı şeyi gösterip göstermediğini değerlendirmek için, tüm görüntüyü karşılaştırmaktan ziyade küçük, tekrarlanabilir ipuçlarını karşılaştırmak daha verimlidir. Bu ipuçlarını seçme işlemi özellik tespitidir. Görüntüler arasında eşleşme gerektiren herhangi bir işlemin giriş noktasında yer alır - kamera hareketi tahmini, panorama birleştirme, 3B yeniden yapılandırma, görüntü alma, görsel inceleme. Bu makale, "nereden seçim yapılacağını" "seçilen noktaların nasıl eşleştirileceğini" birbirinden ayırır ve klasik algoritmaların ardındaki düşünceyi hem denklem hem de uygulama açısından düzenler.

Tripod üzerine monte edilmiş Intel RealSense D435 derinlik kamerasıIntel RealSense D435

Resim: Intel RealSense derinlik kamerası D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons. Temsili bir kamera, yalnızca özellik algılama cihazı değil.

30 Saniyelik Özet

  • Özellik noktalarını düz duvarlara değil, birden fazla yönde yoğunluk değişimi olan köşelere veya parlaklığı çevresinden farklı olan noktalara yerleştirin. Küçük bir görüntü dönüşümünden sonra aynı yerde yeniden tespit edilebilmesi (tekrarlanabilirlik) önemlidir.

  • Köşe tespiti, yerel gradyanların iki yönlülüğünü yakalar; leke tespiti, belirli bir ölçekte yerel olarak farklı bir parlaklık yamasını yakalar. DoG, birden fazla bulanık görüntünün farkından leke adaylarını hızla arar.

  • FAST, yalnızca bir daire üzerindeki pikselleri karşılaştırarak köşeleri hızla belirler. ORB, FAST'ı bir görüntü piramidi, yönelim tahmini ve döndürülmüş bir BRIEF ikili tanımlayıcı ile birleştirerek gerçek zamanlı kullanıma uygun hale getirir.

  • SIFT, DoG aracılığıyla ölçeği seçer, yönelimi bir gradyan-yön histogramı ile normalleştirir ve 128 boyutlu bir tanımlayıcı oluşturur. Hesaplama ve bellek maliyeti artar, ancak ölçek ve döndürme değişikliklerine karşı dayanıklıdır.

  • Yalnızca tespit, eşleşmeyi belirlemez. Tanımlayıcı mesafesi, oran testi ve RANSAC tabanlı geometrik doğrulama, tek bir işlem hattı olarak birlikte değerlendirilmelidir. Son zamanlarda, SuperPoint, ALIKED ve LightGlue gibi öğrenmeye dayalı tespit ve eşleştirme yöntemleri de pratik hale geldi.

Özellik Noktası Nedir — "Öne Çıkan Bir Nokta" Değil, "Tekrar Bulabileceğiniz Bir Nokta"

Piksel koordinatları \mathbf{x}=(x,y)^\mathsf{T} ve görüntü I(\mathbf{x}) olsun. Özellik noktası, komşu yaması hafif bir öteleme, döndürme veya ölçeklendirmeden sonra bile aynı fiziksel konum olarak kararlı bir şekilde tespit edilebilen ve çevresindeki desenle diğer noktalardan ayırt edilebilen bir konumdur. İlki dedektör, ikincisini sayısal bir vektöre veya bit dizisine dönüştüren her şey ise tanımlayıcı olarak adlandırılır.

Bu ikisi birbirinden farklıdır. FAST, prensip olarak bir dedektördür; BRIEF bir tanımlayıcıdır; ORB ise her ikisini birleştiren bir mekanizmadır. SIFT, bir DoG dedektörü ve bir gradyan histogram tanımlayıcısının birleşimidir. Sadece isimleri karşılaştırmak kafa karışıklığına yol açar, bu yüzden bundan sonra bunu her zaman üç aşama olarak ele alacağız: "noktaları seçme", "çevreyi temsil etme" ve "noktaları eşleştirme".

Diagram 1 · Use the button to switch views
The flow of feature-based matchingDiagram showing feature points and descriptors extracted from two images, candidate correspondences geometrically verified with RANSAC, to obtain reliable correspondences. Image AInput frameDetect + describekeypoints / descriptorsScale and orientation stored tooCandidate matchingDistance, ratio testGeometric verificationRANSACCorrespondence / poseThe same extraction runs on Image B too

Şekil: Duskcoil tarafından oluşturulmuştur. Sistem kalitesi, tespit sayısıyla değil, geometrik olarak tutarlı sonuçlanan eşleşme sayısıyla belirlenir.

Köşeler: İki Yönde Değişen Yerlerin Seçilmesi

En sezgisel özellik köşedir. Bir görüntü yaması W küçük bir yer değiştirme \mathbf{u}=(u,v)^\mathsf{T} ile kaydırıldığında görünen değişimi SSD (kare farklarının toplamı) olarak yazın:

E(\mathbf{u})=\sum_{\mathbf{x}\in W} w(\mathbf{x})\left[I(\mathbf{x}+\mathbf{u})-I(\mathbf{x})\right]^2 \simeq \mathbf{u}^{\mathsf{T}}\mathbf{M}\mathbf{u}

Birinci dereceden Taylor yaklaşımı altında, yerel yapı (ikinci moment) matrisi \mathbf{M} şu hale gelir:

\mathbf{M}=\sum_{\mathbf{x}\in W}w(\mathbf{x}) \begin{bmatrix}I_x^2&I_xI_y\\I_xI_y&I_y^2\end{bmatrix}

burada I_x,I_y görüntü gradyanlarıdır ve w, Gauss penceresi gibi bir ağırlıktır. \mathbf{M}'nin özdeğerleri \lambda_1,\lambda_2 olsun; bir nokta, daha küçük özdeğerin bile büyük olduğu bir köşedir. Gradyanın yalnızca bir yönde büyük olduğu bir kenarda, bir özdeğer küçük kalır. Düz bölgelerde, her ikisi de küçük kalır. Harris dedektörü, her pikselde özdeğerleri açıkça çözmez; bunun yerine aşağıdaki yanıt değerinin yerel maksimumlarını seçer:

R=\det(\mathbf{M})-k\,\mathrm{trace}(\mathbf{M})^2 =\lambda_1\lambda_2-k(\lambda_1+\lambda_2)^2

k tipik olarak 0,04–0,06 civarındadır. Harris, dönüşe karşı nispeten dayanıklıdır, ancak sabit boyutlu bir pencereden baktığı için, nesne önemli ölçüde büyütüldüğünde veya küçültüldüğünde aynı noktayı seçme mekanizması yoktur. Shi–Tomasi'nin \min(\lambda_1,\lambda_2)'sı da köşeleri seçmek için uygun pratik bir kriter olarak yaygın olarak kullanılır. izleme.

Lekeler: Köşesi Olmasa Bile Bir "Leke" Faydalı Bir İpucudur

Köşeler tek başına yuvarlak logoları, noktaları, karanlık delikleri veya parlak bir yansımanın merkezini yeterince algılayamaz. Bu nedenle bir leke dedektörü, belirli bir ölçekte, çevrelerine göre yerel olarak farklı parlaklık yamaları bulur. Gauss fonksiyonu ile düzeltilmiş ölçek uzayını şu şekilde yazın:

L(\mathbf{x};\sigma)=G(\mathbf{x};\sigma)*I(\mathbf{x})

burada * evrişimdir ve \sigma "hangi boyuta baktığımızı" temsil eder. Gauss Laplacian'ının (LoG) ölçek normalleştirilmiş yanıtı,

\sigma^2\nabla^2L=\sigma^2(L_{xx}+L_{yy})

parlak bir arka plan üzerinde koyu bir daireye veya koyu bir arka plan üzerinde parlak bir daireye güçlü bir şekilde yanıt verir. Sadece konumda değil, üç boyutlu (x,y,\sigma) uzayda da ekstrem noktaları bulmak, \sigma yönü, bir lekenin merkezini ve karakteristik boyutunu aynı anda seçer. Bunu ayrıca, yarıçapı yaklaşık olarak \sqrt{2}\sigma olan dairesel bir lekeye karşılık gelen ölçek olarak da yorumlayabilirsiniz.

LoG harika bir fikir, ancak her ölçekte tam ikinci türevi hesaplamak pahalıdır. Bu yaklaşım ve hızlanma, DoG'ye ve oradan da SIFT'e yol açar.

DoG: Bulanıklık Farkından Ölçekten Bağımsız Adayları Bulma

Gauss Farkı (DoG), iki bitişik bulanık görüntü arasındaki farktır:

D(\mathbf{x};\sigma)=L(\mathbf{x};k\sigma)-L(\mathbf{x};\sigma)

burada k>1 bitişik ölçekler arasındaki orandır. Sabit bir faktöre kadar, DoG ölçek normalleştirilmiş LoG'yi yaklaşık olarak hesaplar, böylece leke adayları yalnızca bir ek evrişimle aranabilir. Uygulamada, görüntüyü kademeli olarak bulanıklaştırarak bir Gauss piramidi oluşturursunuz ve her DoG pikselini aynı ölçekteki 8 komşusuna ve her birinden 9 komşusuna karşı karşılaştırırsınız. Yukarıdaki ve aşağıdaki ölçekte toplam 26 nokta. Maksimum veya minimum değer, onu aday yapar.

Adaylar olduğu gibi kullanılmaz. Zayıf uç noktalar gürültüdür ve reddedilir, aynı şekilde uzun kenarlar boyunca uç noktalar da reddedilir. Bir DoG uç noktası etrafında 3 boyutlu bir ikinci dereceden enterpolasyon, alt piksel konumunu ve ölçeğini verir. Hessian için

\mathbf{H}=\begin{bmatrix}D_{xx}&D_{xy}\\D_{xy}&D_{yy}\end{bmatrix}

büyük bir \mathrm{Tr}(\mathbf{H})^2/\det(\mathbf{H}), yalnızca bir ana eğriliğin güçlü olduğu bir kenar yanıtını gösterir ve bu noktalar hariç tutulur. Bu, köşe tespitinde olduğu gibi aynı sorunu ele alır: bir kenar üzerindeki bir nokta, kenar boyunca kaydırıldığında bile benzer görünür, bu nedenle karşılığı benzersiz bir şekilde belirlenemez.

HIZLI: Sadece Bir Çembere Bakarak Köşeleri Hızlıca Değerlendirme

Hızlandırılmış Segment Testinden Özellikler (FAST), p pikseli etrafındaki yarıçapı 3 olan bir Bresenham çemberindeki 16 pikseli kullanır. Bir eşik verildiğinde t, eğer n ardışık piksel (tipik olarak 9 veya 12) I_p+t'den daha parlak veya I_p-t'ten daha koyu ise, p bir köşe olarak değerlendirilir.

\exists\,S_n:\quad \forall q\in S_n,\quad I_q>I_p+t\quad\text{or}\quad I_q<I_p-t

Gradyan veya matris hesaplamadığı için -sadece az sayıda piksel karşılaştırması ve erken reddetme- son derece hızlıdır. Daire üzerindeki 1, 5, 9 ve 13 saat yönündeki pikselleri önce kontrol eden ve sürekli bir parlak/koyu piksel dizisi oluşamıyorsa hemen duran tasarım, hızının anahtarıdır. Öte yandan, düz FAST ne ölçek ne de yönlendirme sağlar ve kenarlar boyunca birçok noktaya yanıt verme eğilimindedir. Çevreden yoğunluk farkını puanladıktan, maksimum olmayan bastırma (NMS) uyguladıktan ve bir görüntü piramidiyle birleştirdikten sonra ancak bunu yapar. Pratik bir çok ölçekli dedektör haline gelir.

ORB: FAST'ı "Hızlı ama Kullanımı Zor" Olarak Bırakmamak

ORB (Yönlendirilmiş FAST ve Döndürülmüş BRIEF), gerçek zamanlı görüntü eşleştirmeyi hedefleyen, FAST ve BRIEF'i güçlendiren bir yapıdır. İlk olarak, her bir azaltma oranı s için bir görüntü piramidi üzerinde FAST çalıştırır ve her seviyeden en üst noktaları korur. Bu, tam olmasa da, ölçek değişimine karşı sağlamlık sağlar.

Ardından, p noktası etrafındaki yamanın yoğunluk merkezini hesaplar. Anlardan itibaren

m_{pq}=\sum_{x,y}x^py^q I(x,y),\qquad \mathbf{c}=\left(\frac{m_{10}}{m_{00}},\frac{m_{01}}{m_{00}}\right)

merkez p'dan merkez \mathbf{c}'e olan açı \theta=\operatorname{atan2}(m_{01},m_{10}) baskın yönelim haline gelir. BRIEF tanımlayıcısı, yama içindeki piksel çiftlerini (\mathbf{a}_i,\mathbf{b}_i) karşılaştıran bir bit dizisidir:

\tau_i=\begin{cases}1&I(\mathbf{a}_i)<I(\mathbf{b}_i)\\0&\text{otherwise}\end{cases}

yaklaşık 256 kez düzenlenmiştir. ORB'de, nokta çifti koordinatları karşılaştırmadan önce \theta ile döndürülür, bu nedenle döndürmeden sonra bile aynı bit deseni elde edilir. Düşük korelasyonlu karşılaştırma çiftlerini seçmeyi öğrenen rBRIEF, bitlerin bilgi içeriğini korumanın başka bir yoludur. İkili dizeler arasındaki mesafe, Hamming mesafesi olarak hızlı bir şekilde hesaplanabilir - XOR'dan sonra ayarlanmış bit sayısı.

ORB'nin gücü, CPU'larda ve gömülü cihazlarda hız ve bellek verimliliğidir ve Görsel SLAM'de yaygın olarak kullanılmaktadır. Bununla birlikte, büyük ölçek farklılıkları, yoğun bulanıklık veya önemli bakış açısı değişikliği altında, daha zengin gradyan açıklamalarına sahip SIFT veya öğrenme tabanlı özellikler avantajlı olabilir.

SIFT: Ölçek, Yön ve Açıklamayı Tutarlı Bir Şekilde Normalleştirme

Ölçekten Bağımsız Özellik Dönüşümü (SIFT), DoG aracılığıyla (x,y,\sigma)'in uç noktalarını tespit eder ve Düşük kontrastlı noktaları ve kenar tepkilerini ortadan kaldırır. Her noktanın çevresinde, gradyan büyüklüğünü ve yönünü hesaplar ve Gauss ağırlıklı bir yönelim histogramı oluşturur. En büyük tepe, yamanın dönüşünü normalleştirmek için kullanılan baskın yönelim haline gelir ve maksimumun %80'ini aşan ikincil tepelere de kendi yönelimleri atanır. Bu, dönüşe karşı dayanıklılığının özüdür.

Tanımlayıcı için, yaklaşık 16\times16 boyutunda normalleştirilmiş bir pencere 4\times4 hücreye bölünür ve her hücreye 8 yönlü bir gradyan histogramı atanır. Bu nedenle boyut 4\times4\times8=128'dir. \mathbf{d} vektörü L2-normalleştirilir ve 0,2'yi aşan elemanlar kırpılır ve yeniden normalleştirilir, böylece yerel aydınlatma değişimine duyarlılık bastırılır.

\hat{\mathbf{d}}=\frac{\mathbf{d}}{\|\mathbf{d}\|_2},\qquad d_i\leftarrow\min(\hat d_i,0.2),\qquad \mathbf{d}\leftarrow\frac{\mathbf{d}}{\|\mathbf{d}\|_2}

Başka bir deyişle, SIFT'in "değişmezliği" sihir değildir. Bu, yerel aydınlatma değişimine duyarlılığı ele alan açık bir tasarımdır. Varyasyon kaynaklarının her birini ayrı ayrı ele alır: görüntü piramidi aracılığıyla ölçek seçimi, baskın yönelimle koordinat çerçevesinin döndürülmesi ve normalizasyon yoluyla kontrastın emilmesi. Afin deformasyona veya büyük bakış açısı farklılıklarına karşı tam koruma sağlamaz; bunlar için RANSAC veya çoklu görünüm geometrisi gereklidir.

Minimal Uygulama Sözde Kodu

Özellik noktası işleme, çıkarma aşamasında durmamalıdır; yazışma doğrulamasına kadar uygulanmalıdır. Aşağıda, ORB veya SIFT için geçerli olan bir iskelet bulunmaktadır.

function match_images(imageA, imageB, method):
    grayA, grayB = to_gray(imageA), to_gray(imageB)
    detector = create(method)        # ORB: FAST+pyramid+rBRIEF / SIFT: DoG+gradient
    keyA, descA = detector.detect_and_compute(grayA)
    keyB, descB = detector.detect_and_compute(grayB)

    metric = HAMMING if method == ORB else L2
    tentative = []
    for each descriptor a in descA:
        b1, b2 = two_nearest(a, descB, metric)
        if distance(a, b1) < 0.75 * distance(a, b2):
            tentative.append((a.keypoint, b1.keypoint))

    H, inlier_mask = RANSAC_HOMOGRAPHY(tentative, reproj_threshold=3px)
    return tentative[inlier_mask], H

Sadece en yakın komşuyu almak, sonuçta pencere çerçeveleri, ızgaralar ve tekrarlayan desenler gibi belirsiz noktalar bırakır. Lowe'un oran testi, en iyi mesafenin d_1 ikinci en iyi mesafeye d_2 oranını kullanır ve ikinciye olan fark yeterince büyük olmayan adayları atar. RANSAC daha sonra küçük rastgele alt kümelerden bir homografi \mathbf{H} veya temel matris tahmin eder. Bir hipotez olarak eşleşmeleri ele alır ve küçük yeniden projeksiyon hatasıyla en fazla eşleşmeyi (içsel noktaları) açıklayan hipotezi seçer. Nesne düzlemsel ise veya kamera sadece yerinde döndürülmüşse, tutarlılık homografi ile kontrol edilebilir.

\tilde{\mathbf{x}}'\sim\mathbf{H}\tilde{\mathbf{x}}

Genel bir 3B sahne için, bunun yerine temel/esas matris kullanılır. Bu noktaya kadar kalan içsel nokta sayısı ve oranı, aslında kullanılabilir özellik miktarıdır.

Aydınlatmaya, Ölçeğe ve Döndürmeye Karşı Dayanıklı Olan ve Ne Derecede Dayanıklı Olan Özellikler

Aydınlatma değişimine karşı, basit bir parlaklık kayması I'(x,y)=I(x,y)+b piksel farklılıklarını yok eder, ancak gradyanlardaki veya ikili karşılaştırmalardaki göreceli ilişkiler üzerinde çok az etkisi vardır. Tekdüze bir kontrast değişimi I'=aI+b de SIFT'in tanımlayıcı normalizasyonu tarafından oldukça iyi ele alınır. Ancak yerel yapının kendisi değiştiğinde — pozlama doygunluğu, gölge sınırları, yansımalar, gündüz ve gece — klasik yöntemler tek başına hiçbir garanti sunmaz. Yakalama sırasında, sabitleyin veya sıkıca yönetin. Pozlamayı ayarlayın ve gerekirse, her iki görüntüye de aynı koşullar altında CLAHE gibi yerel kontrast düzeltmesi uygulayın. Aşırı düzeltme, gürültüyü sahte özelliklere dönüştürme riskini taşır, bu nedenle dikkatli olun.

Tek çözünürlüklü Harris veya FAST, ölçek değişimine karşı doğal olarak zayıftır. Görüntü piramidi boyunca adayları arayan ORB, pratik bir toleransa sahiptir, ancak DoG aracılığıyla sürekli ölçek uç noktalarını seçen SIFT ile aynı normalizasyona sahip değildir. Doku azaltılmış ölçekte kaybolursa, hiçbir yöntem karşılık bulamaz. Giriş çözünürlüğü, piramit derinliği ve minimum yama boyutu, beklenen yakalama mesafesi varyasyon aralığından belirlenmelidir.

Döndürmeye karşı, Harris yanıtının kendisi nispeten kararlıdır, ancak eşleştirme, tanımlayıcının koordinat çerçevesinin de döndürülmesini gerektirir. ORB, yönelimi yoğunluk merkez noktası aracılığıyla, SIFT ise gradyan yönü histogramı aracılığıyla atar. Bu tür sürekli açı normalizasyonu, yalnızca 90 derecelik döndürme adımlarını işleyen bir tanımlayıcıdan daha etkilidir. Bu arada, güçlü bir eğik görünüm, döndürme ve ölçekleme değil, bir Affine/projektif deformasyon yerine, çoklu görünüm verileri, affine-kovaryant özellikler veya geometrik doğrulama ile birleştirilmiş öğrenme tabanlı özellikler kullanılır.

Değerlendirme Metrikleri: Nokta Sayısını Değil, Kullanılabilir Eşleşmeleri Ölçün

Bilinen bir homografiye sahip bir görüntü çifti için, A görüntüsünden B görüntüsüne \mathbf{x}_i noktasını yansıtın ve \epsilon mesafesindeki bir nokta tespit edilen nokta kümesinde K_B mevcutsa, bunu başarılı bir yeniden tespit olarak sayın. Tekrarlanabilirlik kavramsal olarak

\mathrm{Repeatability}=\frac{\#\{\mathbf{x}_i\in K_A: \min_{\mathbf{y}\in K_B}\|H\mathbf{x}_i-\mathbf{y}\|<\epsilon\}}{\min(|K_A|,|K_B|)}

Ancak tanımlayıcılar ayırt edemiyorsa aynı konumu bulmak işe yaramaz. Bu nedenle, eşleşme hassasiyetini (doğru eşleşmelerin oranı), doğru eşleşme sayısını, RANSAC sonrası iç nokta oranını, tahmin edilen pozun döndürme/öteleme hatasını, işlem süresini ve belleği de rapor edersiniz. HPatches, aydınlatma değişimini ayıran temsili bir kıyaslama aracıdır. Yama eşleştirme, dedektörler ve homografi tahminini değerlendirmek için bakış açısı değişikliği. Uygulamanızın geometrisine (düzlemsel veya geniş tabanlı 3B) uyan verilerle ölçüm yapmadığınız sürece, tek bir puanın sıralamasını olduğu gibi benimsememelisiniz.

Yöntem Algılama çekirdeği Tanımlayıcı Ölçek/döndürme Eşleştirme mesafesi Güçlü yönler Başlıca sakıncalar
Harris + yama Yapı matrisi Ham yama, vb. Ölçek ✕, döndürme ayrı SSD/NCC Net prensip Aydınlatmaya/ölçeğe karşı zayıf
LoG / DoG Ölçek uzayı blob ekstremumları Ayrı bir tanımlayıcı gerektirir Ölçek ◎, döndürme ayrı Tanımlayıcıya bağlıdır Blob ve ölçek alır Piramit hesaplaması gereklidir
FAST + ÖZET Daire üzerinde sürekli parlaklık İkili karşılaştırma Tek başına değil Hamming Çok hızlı Bakış açısına/ölçeğe karşı zayıf
ORB Piramit HIZLI Döndürülmüş rÖZET Ölçek ○, döndürme ○ Hamming Hafif, gerçek zamanlı dostu Büyük deformasyon altında sınırlı
SIFT DoG ekstremumları 128 boyutlu gradyan histogramı Ölçek ◎, döndürme ◎ L2 Sağlam, iyi doğrulanmış CPU/bellek yoğun
Öğrenme tabanlı Ağ üzerinden öğrenilmiş Öğrenilmiş vektör Veri yoluyla güçlendirilmiş L2 / öğrenilmiş Zor koşullarda yüksek eşleşme oranı Model, GPU, tekrarlanabilirlik yönetimi gerektirir

Tablodaki ○ ve ◎ mutlak derecelendirmeler değildir; tipik uygulamalar ve beklenen aralıklar için göreceli kıyaslamalardır. Aynı ızgara deseni kullanıldığında SIFT bile belirsizdir. Çerçeveyi doldurur ve hatta ORB, orta dereceli koşullar altında yeterli sayıda iç nokta elde edebilir.

Mevcut Kütüphanelerde ve Gerçek Ürünlerdeki Yeri

İlk prototip için, OpenCV'nin cv::ORB::create(), cv::SIFT::create() ve cv::FastFeatureDetector::create() ile çalışmak kolaydır. ORB, BFMatcher(NORM_HAMMING) ile eşleşir; SIFT ise L2 mesafeli BFMatcher veya FLANN tabanlı bir eşleştirici ile çalışır. Dedektör ve tanımlayıcıyı ayırmak isteseniz bile, OpenCV'nin Feature2D API'si sizi aynı akışta tutar. Öğrenmeye dayalı deneyler ve GPU işleme için, PyTorch üzerindeki Kornia, SIFT, ORB, DISK, KeyNet/HardNet, LightGlue ve daha fazlasını yapı taşları olarak sağlar.

Fotogrametri ve 3B rekonstrüksiyon pratiğinde, COLMAP temsili araçtır; mevcut resmi dokümantasyonu, standart SIFT'i ve ALIKED'ı destekler. ONNX etkinleştirildi. Hem SIFT hem de ALIKED, kaba kuvvet eşleştirme veya LightGlue eşleştirmeye bağlanabildiğinden, yeniden yapılandırma giriş noktasında klasik ve öğrenme tabanlı yaklaşımları karşılaştırmak kolaydır. Bir ürün veya kütüphane seçerken, öncelikle model adının yeni olup olmadığına değil, yalnızca CPU'da çalışması gerekip gerekmediğine, gecikme bütçesine, ağır çevrimdışı eşleştirmenin kabul edilebilir olup olmadığına ve tekrarlanabilir sürüm sabitlemesinin gerekli olup olmadığına karar vermek daha iyidir.

Son Araştırmalar: Tespit, Tanımlama ve Eşleştirmeyi Birlikte Optimize Etme

Öğrenme tabanlı yaklaşımlar için bir dönüm noktası SuperPoint oldu. Tamamen evrişimli bir ağ, Homografik Adaptasyon yoluyla kendi kendine denetimli olarak öğrenerek, geometrik dönüşümler boyunca noktaları yeniden üretmek için aynı anda bir ilgi noktası olasılık haritası ve bir tanımlayıcı haritası üretir. Bu, yalnızca elle tasarlanmış bir "köşe olma" kavramına güvenmek yerine, karşılık gelen yararlı konumların nerede olduğunu verilerden öğrenme fikridir.

DISK, seyrek noktaları seçmenin ve eşleştirmenin ayrık ve ayırt edilmesi zor olduğu sorununu ele almaktadır. Doğru eşleşme sayısını ödüllendiren politika gradyanları ile uçtan uca tespit ve tanımlamayı optimize ederek. ALIKED, her anahtar nokta etrafında deforme edilebilir destek konumlarını öğrenen Seyrek Deforme Edilebilir Tanımlayıcı Başlığı kullanır ve yoğun özellik haritasının tamamından değil, seyrek noktalardan tanımlayıcılar çıkararak ifade gücü ve verimlilik arasında denge kurmayı hedefler.

Eşleştiriciler de bağımsız en yakın komşu aramasından uzaklaşıyor. LightGlue, bir görüntü çifti kolay olduğunda erken duran uyarlanabilir hesaplama ile bir dikkat mekanizması kullanarak iki yerel özellik kümesi arasındaki eşleşmeleri tahmin eder. Bu, kendi başına bir özellik dedektörü değildir, ancak dedektörden iyi bir tanımlayıcı mesafesinin tek başına iyi nihai eşleşmeleri garanti etmediğinin önemli bir hatırlatıcısıdır. Şu anda, hedef verilerinizde aynı RANSAC ayarları altında, klasik özellikler kullanan hafif bir eşleştirici ile bir kurulumu, SuperPoint/ALIKED gibi öğrenilmiş özellikleri LightGlue ile eşleştiren bir kurulumla karşılaştırmak pratiktir.

Seçim ve Ayarlama Kontrol Listesi

  • İlk olarak, tespit sayısını, oran testi geçme sayısını kaydedin, Gerçek görüntü çiftlerinde RANSAC iç nokta sayısı, iç nokta oranı ve işlem süresi. Yalnızca tespit sayısını artırmak, uyumsuzluklar da artarsa ters tepebilir.

  • Sabit bir kameranın yakınında kısa süreli izleme için FAST/ORB ile başlayın ve nfeatures, FAST eşiği ve piramit seviyelerini ayarlayın. Düşük doku altında, eşiği düşürmeden önce bulanıklığı, pozlamayı ve odaklamayı kontrol edin.

  • Yakalama mesafesinde veya dönüşünde büyük değişiklikler olan hareketsiz görüntüleri eşleştirmek için SIFT'i temel olarak kullanın. Daha hızlı bir yöntemin SIFT'i geçip geçmediği her zaman aynı veriler üzerinde aynı geometrik doğrulama ile doğrulanmalıdır.

  • Gece, güçlü arka ışık altında, mevsimsel değişikliklerde veya geniş bakış açısı farklılıklarıyla, öğrenmeye dayalı özellikleri de göz önünde bulundurun. Ancak performans değerlendirmesine eğitim verileri ile hedef ortam arasındaki boşluğu, model güncellemelerini ve GPU kullanılabilirliğini de dahil edin.

  • Tekrarlayan desenler, yansıtıcı yüzeyler, hareketli nesneler ve aşırı hareket bulanıklığı, özellik tespiti probleminden ziyade gözlem belirsizliğidir. Maskeleme, zamansal izleme, sensör füzyonu ve yakalama ile telafi edin. planlama.

Özellik tespiti, görüntüleri anlamak için her amaca uygun bir sınıflandırıcı değildir. Ancak, az hesaplama gücüyle hangi piksellerin geometriyi destekleyebileceğini seçmek için etkili bir temel teknoloji olmaya devam etmektedir. Köşeler, lekeler, ölçek alanı ve yönelim normalizasyonu kavramlarını anlamak, ister klasik ORB/SIFT'i ayarlıyor olun ister öğrenmeye dayalı özellikleri değerlendiriyor olun, sayıların arkasındaki başarısızlık nedenlerini izlemenizi sağlar.

Anlayışınızı kontrol edin
Güçlü bir kenardaki her noktayı izlemek kolay mı?

Tek bir kenar boyunca hareket belirsizdir. Köşeler, farklı yönlerde yoğunluk değişiklikleri sağlayarak iki boyutlu hareketi tanımlamayı kolaylaştırır.

Referanslar

Özellik çıkarma laboratuvarında sentetik görüntüyü döndürün ve Harris ile Shi–Tomasi algılamalarını karşılaştırın.

What to read next

Review the backgroundKamera Kalibrasyonu Temel Bilgileri — Objektif Bozulmasını ve İçsel Parametreleri Geri KazanmaContinue the seriesGörüntü parlaklığı ve luminans Lab — pozlama, gama ve kırpmaExplore another aspect of this fieldÖzellik noktası çıkarma laboratuvarı — Harris ve Shi–Tomasi karşılaştırması