Contents — find the section you need

Görsel-SLAM, yalnızca kamera görüntülerine (veya kamera artı IMU kombinasyonuna) dayanarak kendi kendini konumlandırma ve haritalama yapan teknikler ailesidir. LiDAR gibi pahalı bir mesafe sensörüne ihtiyaç duymaz, ancak bir zayıflığı vardır - aydınlatma değişikliklerine ve dokusu zayıf sahnelere karşı hassasiyet - ve bu zayıflığın üstesinden gelme tarihi esasen teknolojinin kendisinin bir trendidir.

OpenCVOpenCV

Resim: OpenCV logosu, Wikimedia Commons (Apache 2.0)

Visual-SLAM'e Genel Bakış

Diagram 1 · Use the button to switch views
Visual-SLAM, anahtar noktaları veya yoğun korelasyonu kullanarak kareler arasında eşleşme bulur, poz ve derinliği tahmin eder ve demet ayarlaması yoluyla yörünge ve haritayı birlikte uzlaştırır

Diyagram: Duskcoil. Klasik ve öğrenme tabanlı yaklaşımların paylaştığı geometrik ilişkileri gösterir.

Visual-SLAM'deki temel sorun, kareler arasında aynı yeri ilişkilendirmek ve bu ilişkilendirmeleri tutarlı kılan kamera hareketini ve 3B yapıyı birlikte kurtarmaktır. Klasik yöntemler seyrek anahtar noktaları açıkça eşleştirir; öğrenme tabanlı yöntemler yoğun özelliklerden veya öğrenilmiş ön bilgilerden karşılıkları çıkarır. Her ikisi de gözlem-poz-yapı tutarlılığıyla sınırlıdır. Haritanın seyrek bir nokta bulutu, yoğun bir derinlik veya bir sinirsel temsil olup olmadığı, önemli bir pratik seçimdir.

Özellik Noktası Tabanlı Uç Nokta: ORB-SLAM3

Klasik Visual-SLAM'in bir uç noktası ORB-SLAM3'tür. Monoküler, stereo veya RGB-D kurulumlarında Visual, Visual-Inertial veya çoklu harita SLAM'i gerçek zamanlı olarak çalıştırabilir, ORB adı verilen bir özellik tanımlayıcısı kullanarak görüntüler arasında karşılık bulabilir ve ardından paket ayarlaması yoluyla poz ve harita noktalarını optimize edebilir. Paket ayarlamasının en aza indirdiği şey, 3 boyutlu harita noktası \mathbf{X}_i'ün kamera pozisyonu (\mathbf{R}_j, \mathbf{t}_j) altında görüntüye yansıtıldığında düştüğü yer ile karşılık gelen özellik noktası \mathbf{u}_{ij}'in görüntüde gerçekte gözlemlendiği yer arasındaki uyumsuzluğun (yeniden projeksiyon hatası) toplamıdır.

\min_{\{\mathbf{R}_j, \mathbf{t}_j\}, \{\mathbf{X}_i\}} \sum_{i,j} \left\| \pi\left( \mathbf{R}_j \mathbf{X}_i + \mathbf{t}_j \right) - \mathbf{u}_{ij} \right\|^2

Burada \pi(\cdot), kameranın içsel parametrelerine dayalı olarak 3 boyutlu bir noktadan görüntü düzlemine olan projeksiyon fonksiyonudur. Bu ifadenin hem kamera pozisyonu hem de harita noktaları üzerinden birlikte optimize edilmesi, daha önce ele alınan grafik optimizasyonu ile aynı doğrusal olmayan en küçük kareler çerçevesinde çözülen paket ayarlamasının özüdür (ayrıntılar için "SLAM'deki Teknoloji Trendleri" bölümüne bakın). Yayınlanmasından yıllar sonra bile, araştırma makalelerinde karşılaştırma temeli olarak, fiili standart referans uygulaması olarak hala gösterilmektedir.

Derin Öğrenme ile Uçtan Uca: DROID-SLAM

Ayrıca, özellik çıkarma ve eşleştirme gibi açık süreçlerin doğrudan derin öğrenme ile değiştirilmesi yönünde de köklü bir eğilim var. DROID-SLAM, tekrarlayan yinelemeli güncellemeler ve yoğun bir paket ayarlama katmanı aracılığıyla kamera pozisyonunu ve piksel başına derinliği tahmin eden önde gelen bir örnektir. Sadece monoküler video üzerinde eğitilmiş olmasına rağmen, daha iyi doğruluk için test zamanında stereo veya RGB-D videodan da yararlanacak kadar esnektir. Bununla birlikte, hesaplama gereksinimleri klasik yöntemlerden daha yüksektir - yalnızca çıkarım işlemi 11 GB veya daha fazla GPU belleği gerektirir.

DROID-SLAM'ın İç Yapısı: Korelasyon Hacimleri ve Türevlenebilir Paket Ayarlaması

DROID-SLAM'ın açık özellik çıkarma işleminden geçmeden pozisyon ve derinliği nasıl tahmin ettiğine biraz daha yakından bakarsak: önce iki CNN kullanarak (biri özellik çıkarma, diğeri bağlamsal bilgi için) giriş çözünürlüğünün 1/8'inde yoğun özellik haritaları hesaplar. Her bir kare çifti için, her bir özellik vektörü çifti arasındaki nokta çarpımını kapsamlı bir şekilde hesaplayarak bir "4 boyutlu korelasyon hacmi" oluşturur; bu da piksel bazında eşleşmeyi tahmin etmenin temelini oluşturur.

Tahmin işleminin kendisi, yinelemeli bir güncelleme operatörü tarafından gerçekleştirilir. Korelasyon hacminden gelen özellikler, önceki yinelemeden kalan (düzeltme) ile birlikte, evrişimsel katmanlardan geçerek bir ConvGRU'ya (evrişimsel kapılı tekrarlayan birim) girer ve bu da akışa (görünür hareket) bir düzeltme çıktısı verir. Ağın hangi bilgiyi dahil edeceğini ve hangisini atacağını seçici olarak kontrol etmesini sağlayan kapılama mekanizması, bu ağın aslında öğrendiği kısımdır.

Bu yinelemeli güncellemenin çıktısı, kamera pozisyonunu ve piksel başına ters derinliği eş zamanlı olarak güncelleyen türevlenebilir bir Yoğun Paket Ayarlaması (DBA) katmanına beslenir. Geometrik kısıtlamaları bu şekilde açıkça ağa yerleştirmek, tek gözlü eğitimli bir modele bile yeniden eğitim gerektirmeden stereo veya RGB-D girdisini işleme esnekliği sağlar.

Harita Gösterimini Yeniden Keşfetmek: 3B Gauss Splatting ve NeRF

Şu anda en hızlı gelişen alan, haritanın gösterim formatının kendisinin yeniden keşfedilmesidir. Sinirsel Radyans Alanları (NeRF) ve 3B Gauss Splatting (3DGS), fotogerçekçi bir 3B sahneyi düz bir nokta bulutu yerine kompakt bir parametre kümesi olarak temsil edebilir. Bu özellik, SLAM'ın haritalama doğruluğunu, işleme kalitesini ve hesaplama verimliliğini aynı anda sürekli olarak yükseltmektedir.

2026'ya kadar, büyük konferanslarda ve dergilerde yeni 3DGS/NeRF tabanlı yöntemler ortaya çıkmaya devam etti: Sadece RGB videodan küresel optimizasyon yapan Splat-SLAM; LiDAR, IMU ve kamerayı birleştiren Gaussian-LIC/Gaussian-LIC2; yeraltı madenleri gibi zorlu ortamlara yönelik GTS-SLAM; semantik SLAM'a yönelik MTE-SLAM (ICRA 2026); ve fotogerçekçi haritalamayı verimli izleme ile dengeleyen PMET-SLAM. Geleneksel yöntemlerle karşılaştırıldığında, işleme kalitesi ve harita yeniden kullanılabilirliği (ortamı sonradan keyfi bir bakış açısından yeniden işleme yeteneği) açık güçlü yönler olarak gösteriliyor.

2025-2026 Güncel: İleri Beslemeli 3B Temel Modeller Üzerine Kurulmuş SLAM

DROID-SLAM'in tasarımını - yinelemeli tahmin artı türevlenebilir demet ayarlaması - bir adım öteye taşıyan, 2024 sonlarında yayınlanan MASt3R-SLAM (CVPR 2025 Öne Çıkan Makale), iki görünüm 3B yeniden yapılandırma ve yazışma üzerinde önceden eğitilmiş bir temel model olan MASt3R'nin çıktısını "ön bilgi" olarak ele alıyor. Bu sistem, kamera içsel parametreleri bilinmediğinde bile tek bir çerçeve içinde nokta haritası eşleştirme, kamera takibi, yerel harita birleştirme ve döngü kapatma tespiti işlemlerini gerçekleştirir ve bilinen kamera modelleriyle saniyede 15 kare hızında çalışırken, birden fazla kıyaslamada en yüksek doğruluk oranına ulaştığı bildirilmektedir.

Bu temel model hattı, 2025 yılında VGGT'nin (Görsel Geometri Temelli Dönüştürücü) gelişiyle daha da ivme kazandı; bu, tek bir ileri geçişte çoklu görünüm görüntülerinden eş zamanlı olarak kamera pozisyonu, derinlik ve nokta bulutları üreten ileri beslemeli bir 3B temel modelidir. VGGT'nin çıktısı üzerine kurulu bir dizi türev araştırma 2026 yılına kadar devam etti. VGGT-SLAM++ (Nisan 2026), VGGT'nin dönüştürücü çıktısını, yörüngeleri stabilize etmek için sık yerel optimizasyonla (eş görünürlük grafikleri ve görsel yer tanıma yoluyla) birleştirerek eksiksiz bir SLAM sistemine dönüştürür. VGGT-Align (Ağustos 2026), her bir parçanın nokta bulutundan çıkarılan baskın geometrik değişmezleri kullanarak ölçeği kısıtlayarak uzun dizilerdeki parça-parça ölçek kaymasını çözüyor. Ayrıca, VGGT'nin herhangi bir açık denetleyici sinyal olmadan örtük olarak ortak görünürlüğü (hangi bakış açılarının aynı bölgeyi paylaştığı) kodladığını gösteren Co-VGGT (Temmuz 2026) gibi analiz çalışmaları da ortaya çıktı; bu, bu temel modellerin iç temsillerinin aslında neyi yakaladığını anlamaya yönelik aktif bir çabadır.

Karşılaştırma Testlerinin Gösterdiği: Daha Doğru, Ama Her Şeye Çare Değil

Temel model tabanlı SLAM'ın gerçek dünya performansını nicelendiren bir dizi çalışma 2026 yılının ikinci yarısında ortaya çıktı. DJI dronlarından yüksek irtifa dikey görüntüler üzerinde beş monoküler SLAM sistemini karşılaştıran bir değerlendirme, MASt3R-SLAM'ın yol uzunluğunun %0,53'ünde en düşük ortalama yatay mutlak hatayı elde ettiğini bulurken, dikey (irtifa) doğruluğunun açık bir sorun olarak kaldığını belirtti. Ayrı bir çalışma (Ağustos 2026), hem sentetik hem de gerçek dünya bozulmaları altında monoküler SLAM'ı değerlendirirken, klasik özellik tabanlı yöntemlerin bozulmuş koşullar altında "felaket niteliğinde izleme hatası" yaşama eğiliminde olduğunu, öğrenilmiş izleyicilerin ise bu felaket niteliğindeki hatayı büyük ölçüde "sürekli ve bazen şiddetli, kayma" ile değiştirdiğini bulmuştur. Başka bir deyişle, öğrenilmiş yöntemler, dramatik, görünür bir hata modunu, hatanın fark edilmeden biriktiği daha sessiz bir modla değiştirebilir; bu da doğruluk metriklerinin tek başına hangi yaklaşımın gerçekten daha iyi olduğunun tüm hikayesini anlatmadığını hatırlatır.

Ölçek belirsizliği konusunda da (tek bir monoküler beslemenin tek başına mutlak mesafe ölçeğini kurtaramadığı klasik zayıflık), yeni yaklaşımlar ortaya çıkmaktadır. Öğrenilmiş derinlik tahminini olasılıksal bir faktör grafiğine entegre eden Scalix (Ağustos 2026), hem metrik (mutlak ölçek) hem de ölçeklendirmeye kadar (göreceli ölçek) kıyaslamalarında en iyi performansı bildirmektedir.

Pratik Seçim Kriterleri

Bu noktadaki pratik dağılım şu şekildedir:

  • Kaynak kısıtlı, kanıtlanmış başarı geçmişi: ORB-SLAM3 ailesindeki özellik noktası tabanlı yöntemler — gömülü donanımlarda bile bol miktarda gerçek dünya başarı geçmişi
  • Doğruluk öncelikli, bol GPU kaynağı: DROID-SLAM ailesindeki uçtan uca derin öğrenme yöntemleri
  • Tanıdık olmayan ortamlara genelleme, kalibrasyon gerektirmez: MASt3R-SLAM/VGGT ailesindeki ileri beslemeli 3B temel model yöntemleri — dikey doğruluk ve uzun süreli çalışma sırasında kayma gibi açık sorunlar devam etse de
  • Fotogerçekçi harita yeniden kullanımı gerekli: 3DGS/NeRF tabanlı yöntemler — birçoğu hala araştırma aşamasında ve gerçek dünya uygulaması hala geliştirme aşamasında

Bu ailelerin hiçbiri diğerlerinin yerini almıyor — mevcut gerçeklik, kullanım durumlarının bir bölümüne yerleşmeleridir.

Anlayışınızı kontrol edin
İyi bir yeni görünüm oluşturma işlemi doğru kamera pozisyonlarını oluşturur mu?

Oluşturma kalitesini geometri ve yörünge doğruluğundan ayrı olarak ölçün.

Görsel kalite tek başına yerelleştirme yöntemlerini sıralayamaz.

Referanslar

What to read next

Review the backgroundLiDAR-SLAM'deki Teknoloji TrendleriContinue the seriesNavigasyon Teknolojisindeki TrendlerExplore another aspect of this fieldİnsansı Robotlarda Teknoloji Trendleri