Contents — find the section you need
Structure from Motion (SfM) liefert eine spärliche 3D-Punktwolke, die lediglich Merkmalspunkte verbindet. Man kann die Umrisse eines Gebäudes oder die Ecken seiner Textur erkennen, aber Wände und gekrümmte Oberflächen weisen fast keine Punkte auf, und das Ergebnis kann so nicht als „Form“ verwendet werden. Multi-View Stereo (MVS) nutzt die bereits aus SfM oder der Kamerakalibrierung bekannten Kamerapositionen und schätzt die Tiefe für nahezu jedes Pixel im Bild, um daraus eine dichte Punktwolke oder ein Netz zu erstellen. Diese Arbeitsteilung – Positionsbestimmung ist Aufgabe von SfM, dichte Formrekonstruktion Aufgabe von MVS – ist der Ausgangspunkt für das Verständnis des Zusammenhangs zwischen diesen beiden Technologien.
0. 30-Sekunden-Zusammenfassung
-
MVS ist eine Technologie, die aus vielen Bildern mit bekannten Posen eine dichte, pixelgenaue Tiefeninformation schätzt und diese in eine Punktwolke oder ein Netz integriert. Es ist der nachgelagerte Prozess, der die spärliche Punktwolke von SfM zu einer dichten Form auffüllt.
-
Das Kernprinzip ist die Fotokonsistenz: Es wird angenommen, dass ein 3D-Punkt die korrekte Tiefe hat und die entsprechenden Pixel in den mehreren Bildern, die ihn zeigen, eine ähnliche Farbe und Helligkeit aufweisen.
-
Es gibt zwei repräsentative klassische Ansätze: Plane-Sweep, der die Konsistenz bewertet, indem er Tiefenkandidaten als Ebenen durchläuft, und Patch-basiertes MVS (PMVS), das kleine Bildausschnitte iterativ erweitert und filtert.
-
In den letzten Jahren haben Deep-Learning-basierte Methoden, die ein Kostenvolumen durch Faltung verarbeiten (wie z. B. MVSNet), klassische Methoden hinsichtlich Genauigkeit und Robustheit zunehmend übertroffen.
Die resultierenden Tiefenkarten aus mehreren Ansichten werden entweder direkt als Punktwolke verwendet oder mittels TSDF-Fusion oder Poisson-Oberflächenrekonstruktion in ein Netz umgewandelt. Die Echtzeit-Tiefenschätzung mit Stereo- oder Tiefenkameras basiert auf dem Prinzip der Fotokonsistenz, unterscheidet sich jedoch hinsichtlich der Anzahl der Blickpunkte, der Offline-Verarbeitung und des Rechenaufwands.
1. Welche Eingabedaten werden benötigt und was wird berechnet?
Die Eingabe für MVS besteht aus folgenden Informationen, die bereits über SfM oder die Kamerakalibrierung ermittelt wurden:
-
Die Kamerapose und die intrinsischen Parameter i jedes Bildes (werden als bekannt behandelt)
-
Ein Satz von Bildern \{I_1,\dots,I_N\}, die die Zielszene fotografieren
Die Ausgabe ist eine dichte Tiefenkarte \{D_i\} für jedes Bild (oder einen ausgewählten Satz von Referenzbildern) oder die durch Integration der Bilder erhaltene Punktwolke/das Netz. Wenn die Ausgabe von SfM – die spärliche Punktwolke und die Kameraposen – das „Gerüst“ bildet, verleiht MVS diesem Prozess „Fleisch“. Mit unbekannten Posen lässt sich keine dichte Form rekonstruieren – MVS folgt immer SfM oder der Kalibrierung, und es ist ratsam, diese Reihenfolge von Anfang an zu berücksichtigen.
2. Warum reicht eine spärliche Punktwolke nicht aus?
Der Grund, warum SfM nicht direkt eine dichte Punktwolke ausgibt, liegt darin, dass seine Eingabe von der Merkmalserkennung abhängt. Wie wir in der Einführung in die Merkmalserkennung gesehen haben, können nur „aussagekräftige“ Pixel – Ecken, Kanten – stabil erkannt und zugeordnet werden. Eine gleichmäßig texturierte Fläche wie eine glatte Wand besitzt überhaupt keine Merkmalspunkte, wodurch eine große Lücke in der 3D-Punktwolke von SfM entsteht.
MVS hingegen kann die starke Einschränkung nutzen, dass die Posen bereits bekannt sind, sodass es überhaupt keine Merkmalspunkte benötigt. Für jedes Pixel kann es direkt auswerten: „Bleibt dieser Tiefenkandidat in den anderen Bildern konsistent?“ Dies ermöglicht die Tiefenschätzung selbst bei texturarmen Wänden, sofern zumindest ein Muster oder eine Schattierung vorhanden ist (eine völlig strukturlose Oberfläche bleibt ein Schwachpunkt, wie weiter unten erläutert).
3. Das Kernprinzip: Fotokonsistenz
Nahezu alle MVS-Verfahren basieren auf der Annahme der Fotokonsistenz. Angenommen, die Tiefe des 3D-Punktes, der dem Pixel \mathbf{u} in einem Referenzbild entspricht, beträgt d; dieser 3D-Punkt kann wie folgt rekonstruiert werden:
Die Annahme der Fotokonsistenz besagt, dass die Rückprojektion dieses Punktes in ein anderes Bild k am Pixel \mathbf{u}' = \pi_k(\mathbf{X}(\mathbf{u},d)) eine Farbe und Helligkeit nahe I_{\text{ref}}(\mathbf{u}) ergeben sollte. Am einfachsten lässt sich dies als Verallgemeinerung der Disparitätssuche von Stereokameras verstehen – von zwei Blickwinkeln auf N Blickwinkel. Dieser Prozess, der in How Depth Cameras Work und How Stereo Cameras Work beschrieben wird, besteht darin, korrespondierende Pixel zwischen dem linken und rechten Bild durch Helligkeitsabgleich zu finden. Tatsächlich wird die Tiefe für eine Stereokamera mit zwei Augen durch die einfache Formel berechnet:
unter Verwendung der Brennweite f, der Basislinienlänge B und der Disparität d_{\text{disp}}. MVS ist genau diese Operation der „Disparitätssuche und -umrechnung in Tiefe“, erweitert auf eine beliebige Anzahl von Kameras in beliebiger Anordnung.
Eine typische Implementierung verwendet ein kleines Fenster W um das Pixel und misst die Übereinstimmung mit normalisierter Kreuzkorrelation (NCC).
\mathbf{x}' ist der entsprechende Punkt, der durch Abbildung von \mathbf{x} auf das Bild k unter der Annahme einer lokalen Ebene in der Tiefenposition d erhalten wird. \mathrm{NCC} ist robust gegenüber Änderungen der Helligkeitsskalierung und des Offsets und funktioniert daher auch bei Belichtungs- oder Beleuchtungsunterschieden zwischen den Bildern. Die Berechnung dieses Übereinstimmungswerts für jedes Bildpaar und jede Tiefenposition sowie die Auswahl der Tiefe mit dem besten Wert bilden das Rechengerüst von MVS.
4. Die grundlegende Pipeline
Die klassische MVS-Grundform ist zweistufig aufgebaut: Zuerst wird entweder Plane-Sweep oder Patch-basiert die dichte Tiefenkarte jedes Bildes ermittelt. Anschließend werden diese in einem zweiten Schritt zu einer konsistenten 3D-Form fusioniert. Moderne Deep-Learning-basierte Methoden folgen weitgehend diesem zweistufigen Aufbau, ersetzen jedoch die interne Tiefenschätzung durch ein neuronales Netzwerk.
5. Die Plane-Sweep-Methode
Die Plane-Sweep-Methode geht auf einen raumabtastenden Ansatz zum Abgleich mehrerer Bilder zurück, den Collins auf der CVPR 1996 vorstellte. Dabei werden virtuelle Ebenen in regelmäßigen Abständen senkrecht zur optischen Achse der Referenzkamera (oder entsprechend der Szene ausgerichtet) innerhalb des Sichtkegels der Referenzkamera angeordnet und ausgewertet. Die Tiefensuche erfolgt von flach bis tief.
Angenommen, es existiert eine Ebene in einer bestimmten Tiefe d. Punkte auf dieser Ebene können mithilfe einer Homographie-Transformation vom Referenzbild auf ein anderes Bild abgebildet werden. Mithilfe einer Transformation der Form H = K_k(R+\mathbf{t}\mathbf{n}^\mathsf{T}/d)K_{\text{ref}}^{-1}, die in Homographie-Einführung beschrieben ist, wird das andere Bild I_k in den Referenzblickwinkel verzerrt. Die Fotokonsistenz (wie z. B. die NCC aus dem vorherigen Abschnitt) wird für jedes Pixel zwischen dem verzerrten Bild und dem Referenzbild berechnet, und die Kosten werden für jeden Tiefenkandidaten akkumuliert.
Sobald die Kosten für jeden Tiefenkandidaten berechnet wurden, wird die Tiefe mit den minimalen Kosten pro Pixel ausgewählt. Dies ist eine diskrete Tiefensuche, die sich gut mit der GPU-Parallelisierung kombinieren lässt, da viele Tiefenhypothesen gleichzeitig ausgewertet werden. Viele Implementierungen kombinieren dies mit einer semi-lokalen Kostenaggregation (Regularisierung ähnlich wie …). Semi-Global Matching), interpoliert die Tiefe auch in texturarmen Bereichen kontinuierlich aus benachbarten Informationen. Das dichte Rekonstruktionsmodul von COLMAP verwendet ebenfalls einen Ansatz, der dem Plane-Sweep ähnelt und die pixelweise Ansichtsauswahl optimiert (Pixelweise Ansichtsauswahl) – ein repräsentatives Beispiel hierfür ist die Veröffentlichung von Schönberger et al. auf der ECCV 2016.
6. Die Patch-basierte Methode (PMVS)
Anstatt die Tiefe Pixel für Pixel zu erfassen, generiert und erweitert die Patch-basierte Methode direkt eine Menge kleiner rechteckiger Patches, die die Szenenoberfläche abdecken. Ein repräsentatives Beispiel ist PMVS (Patch-based Multi-View Stereo), das 2010 von Furukawa und Ponce auf der IEEE TPAMI veröffentlicht wurde.
Die Verarbeitung erfolgt in drei Schritten: „Anpassen, Erweitern, Filtern“.
-
Anpassen: Zunächst wird eine kleine Anzahl initialer Patches aus Korrespondenzpunkten generiert, die sich leicht als Merkmalspunkte erkennen lassen, wie z. B. SIFT- oder Harris-Ecken. Jeder Patch besitzt eine Mittelpunktposition, eine Normalenrichtung und Die Menge der Bilder, die diesen Punkt erfassen (Sichtbarkeit).
-
Erweitern: Neue Patches werden in die Umgebung der ursprünglichen Patches propagiert, wodurch der abgedeckte Bereich auf die umliegenden Pixel erweitert wird. Position und Normale jedes propagierten Patches werden lokal optimiert, um die Fotokonsistenz mit den umgebenden Bildern zu maximieren.
-
Filtern: Patches mit Sichtbarkeitswidersprüchen (z. B. wenn ein Patch vermeintlich sichtbar ist, obwohl er sich hinter einem anderen befindet) oder geringer Fotokonsistenz werden entfernt.
Im Gegensatz zu Plane-Sweep, das die Tiefe pixelweise unabhängig bestimmt, berücksichtigt PMVS die zusätzliche Information der Patch-Normalen und erzielt daher tendenziell eine höhere Rekonstruktionsgenauigkeit bei schrägen Oberflächen. Da PMVS jedoch auf iterativer Erweiterung und Filterung basiert, verläuft die Erweiterung in Bereichen mit wenigen ursprünglichen Patches oder geringer Textur nicht optimal, und die Rekonstruktion weist häufig Lücken auf.
7. Deep-Learning-basierte Methoden: Das Kosten-Volumen-Konzept
In den letzten Jahren wurden Methoden entwickelt, die die Übereinstimmung pro Tiefenkandidaten darstellen. Nicht mit einer manuell entworfenen Metrik (wie NCC), sondern mit Merkmalen, die von einem Convolutional Neural Network (CNN) gelernt werden, und einem Kostenvolumen, hat sich die Fotokonsistenz etabliert. Ein repräsentatives Beispiel ist MVSNet, das von Yao et al. auf der ECCV 2018 vorgestellt wurde.
MVSNet extrahiert aus jedem Bild eine Merkmalskarte mithilfe eines trainierten Merkmalsextraktors, geht von diskreten Tiefenebenen innerhalb des Sichtkegels der Referenzkamera aus und richtet die Merkmalskarte jedes Bildes mittels einer differenzierbaren Homographie-Verzerrung am Referenzblickpunkt aus. Die Varianz der Merkmalskarten mehrerer Bilder wird zu einem einzigen Kostenvolumen kombiniert, dieses mit einer 3D-Faltung regularisiert und die Tiefe anschließend mittels einer Softmax-Funktion entlang der Tiefenrichtung regressiert. Das Grundgerüst folgt dem Plane-Sweep-Ansatz des „Tiefenabgleichs und der Bewertung“, der Unterschied zu klassischen Methoden besteht jedoch darin, dass die Berechnung der Fotokonsistenz selbst lernbar wird.
Lernbasierte Methoden verhalten sich tendenziell robuster unter Bedingungen, unter denen manuell entworfene Fotokonsistenzmetriken Schwierigkeiten haben – beispielsweise bei wiederholten Messungen. Muster, schwache Texturen – solange die Trainingsdaten ähnliche Situationen beinhalten. Andererseits kann die Leistung in Szenen, die weit außerhalb der Verteilung des Trainingsdatensatzes liegen (unbekannte Materialien, extreme Beleuchtung), nachlassen.
8. Tiefenkartenfusion und Vernetzung
Da Tiefenkarten aus mehreren Ansichten jeweils unabhängig voneinander berechnet werden, führt deren einfache Überlagerung als 3D-Punkte zu Widersprüchen durch Rauschen und Verdeckung (leicht versetzte Punkte an derselben Position häufen sich in mehreren Ebenen an, oder die Tiefenwerte variieren zwischen den Blickwinkeln). Die Fusion konsolidiert diese Tiefenkarten zu einer einzigen, konsistenten Darstellung.
-
Fusion als Punktwolke: Es werden nur die Pixel verwendet, deren Tiefenwerte über alle Blickwinkel hinweg konsistent sind, Tiefenwerte mit geringer Konfidenz werden verworfen und integriert. COLMAP und andere erzeugen auf diese Weise eine dichte Punktwolke.
-
TSDF-Fusion (Truncated Signed Distance Function): Eine volumetrische Methode, die von Curless und Levoy auf der SIGGRAPH 1996 vorgestellt wurde und den Raum in Voxel unterteilt. und akkumuliert eine signierte Distanz in jedem Voxel. Weit verbreitet in der Echtzeit-Tiefenkamerafusion (z. B. KinectFusion) und auch anwendbar für die Fusion von MVS-Tiefenkarten.
-
Meshing: Aus einer Punktwolke oder einem signierten Distanzfeld erzeugen Methoden wie die Poisson Surface Reconstruction (2006) von Kazhdan et al. ein glattes Polygonnetz. Durch Hinzufügen von Textur-Mapping wird ein visuell nutzbares 3D-Modell erstellt.
9. Vergleich repräsentativer Algorithmen
| Aspekt | Plane-Sweep | Patch-basiert (PMVS) | Lernbasiert (MVSNet-Familie) |
|---|---|---|---|
| Prinzip | Durchläuft Tiefenebenen, bewertet die Fotokonsistenz pro Pixel | Erweitert und filtert kleine Patches iterativ | Regularisiert ein Kostenvolumen mit einem CNN und berechnet die Tiefe |
| Genauigkeit | Abhängig von der Tiefenauflösung und Kostenaggregationsdesign; mittel bis hoch | Tendenziell genau bei schrägen oder komplexen lokalen Formen | Hohe Genauigkeit unter Bedingungen, die den Trainingsdaten nahekommen |
Rechenaufwand | Leicht GPU-parallelisierbar, schnell | Tendenziell langsamer als Plane-Sweep aufgrund iterativer Verarbeitung | Schnelle Inferenz nach dem Training; Trainingskosten werden separat berechnet |
Robustheit | Schwach in texturarmen Bereichen | Neigt dazu, Lücken in Bereichen mit wenigen initialen Patches zu hinterlassen | Vergleichsweise robust gegenüber schwacher Textur oder sich wiederholenden Mustern |
Implementierungsschwierigkeit | Mittel (Homographie-Warping und Kostenaggregation) | Hoch (Sichtbarkeitsmanagement und iteratives Erweiterungsdesign) | Hoch (erfordert Trainingsdaten und Netzwerkdesign) |
Repräsentative Implementierungen | COLMAP dense, viele kommerzielle Photogrammetrie-Tools | PMVS/CMVS | MVSNet, nachfolgende lernbasierte Methoden |
10. Beziehung zu Stereo- und Tiefenkameras
MVS teilt dessen Grundprinzip – „Tiefe aus Korrespondenzen zwischen mehreren Blickwinkeln bestimmen“ – MVS verwendet Stereokameras und Tiefenkameras, die jedoch unterschiedliche Positionen einnehmen.
-
Stereokameras nutzen eine feste Zwei-Augen-Anordnung, wodurch die Disparitätssuche auf eine Dimension entlang der Epipolarlinie beschränkt ist. Sie sind für die Echtzeitverarbeitung ausgelegt. Die Plane-Sweep-Methode von MVS kann als Verallgemeinerung dieser Disparitätssuche auf eine beliebige Anzahl von Kameras in beliebiger Anordnung verstanden werden.
-
Tiefenkameras (Strukturlicht, ToF, aktives Stereo) projizieren aktiv Licht und ermöglichen so eine stabile Entfernungsmessung auch bei Oberflächen mit geringer Textur. Da MVS ausschließlich auf passiver Fotokonsistenz basiert, ist es bei Oberflächen mit geringer Struktur naturgemäß benachteiligt – ein deutlicher Unterschied zu aktiven Tiefenkameras.
-
MVS arbeitet grundsätzlich offline und erstellt hochpräzise, hochauflösende Formen aus vielen Bildern (Dutzenden bis Hunderten), während Stereo- und Tiefenkameras Optimiert für die Ausgabe der Tiefeninformationen in Echtzeit, Bild für Bild.
Je nach Anwendung eignen sich Stereo-/Tiefenkameras für Roboter oder AR-Anwendungen, die Echtzeit-Performance erfordern, während MVS für Offline-Anwendungen mit hochpräzisen 3D-Modellen zur Dokumentation von Kulturerbe, für Architekturvermessungen oder Photogrammetrie geeignet sind.
11. Schwierige Bedingungen und häufige Fehlerfälle
-
Texturarme oder einheitliche Oberflächen: Weiße Wände, einfarbige Böden und Himmel liefern kaum Anhaltspunkte für die Fotokonsistenz. Dadurch bleibt die Tiefe entweder unbestimmt oder wird durch Umgebungsrauschen verfälscht.
-
Spiegelnde, transparente oder durchscheinende Objekte: Glas, Wasseroberflächen und metallische Oberflächen verändern ihr Aussehen je nach Blickwinkel und verletzen so die Annahme der Fotokonsistenz.
-
Sich wiederholende Muster: Fliesen, Ziegel und Feldreihen können zu sogenannten „Geisterlösungen“ führen, bei denen eine falsche Tiefe dennoch eine hohe lokale Fotokonsistenz anzeigt.
-
Verdeckung: Bereiche, die nur von bestimmten Standpunkten aus sichtbar sind. Bei fehlerhafter Sichtbarkeitsschätzung kann die Fotokonsistenz anhand des falschen Bildes bewertet werden, was die Tiefenschätzung beeinträchtigt.
-
Unzureichende Anzahl an Blickpunkten oder Parallaxe: Ist die Anzahl der abdeckenden Blickpunkte gering oder die Parallaxe zu klein, steht in Tiefenrichtung von vornherein keine Auflösung zur Verfügung.
12. Praktische Entscheidungen
-
Sind die Posen bereits durch SfM oder Kalibrierung bekannt und liegt der Fokus auf einer möglichst genauen Offline-3D-Rekonstruktion (z. B. Dokumentation von Kulturerbe, Architekturvermessung, Photogrammetrie für Videoproduktionen), bietet sich eine Implementierung der Plane-Sweep-Familie, wie etwa die Dense-Pipeline von COLMAP, als geeigneter Ausgangspunkt an.
-
Ist die Genauigkeit bei schrägen Oberflächen oder komplexen lokalen Formen besonders wichtig, empfiehlt sich ein Patch-basierter Ansatz der PMVS-Familie oder eine Hybridimplementierung, die deren Ideen integriert.
-
Ist bekannt, dass die Szene texturarm ist oder viele sich wiederholende Muster aufweist, sind lernbasierte Methoden (MVSNet-Familie) in der Regel robuster. Die Leistung kann sich in Szenen außerhalb der Trainingsdatenverteilung verschlechtern. Evaluieren Sie daher die Methode anhand von Daten, die Ihrer Zieldomäne möglichst nahekommen, bevor Sie sie einsetzen.
– Für Anwendungen, die Echtzeitleistung erfordern – Roboter, AR/VR, Hinderniserkennung beim autonomen Fahren – sollten Sie Stereokameras oder Tiefenkameras anstelle von MVS in Betracht ziehen. Der Haupteinsatzbereich von MVS ist die Offline-Rekonstruktion mit hoher Dichte und Präzision.
– Wenn das Endergebnis ein Mesh oder ein texturiertes 3D-Modell sein soll, wählen Sie TSDF-Fusion oder Poisson-Oberflächenrekonstruktion in der Tiefenkartenfusionsphase. Reicht eine Punktwolke aus, können Sie hier aufhören.
13. Zusammenfassung
Multi-View Stereo verwendet bereits aus SfM oder Kalibrierung bekannte Kameraposen und rekonstruiert mithilfe der Fotokonsistenz eine hohe Tiefendichte. Die beiden klassischen Ansätze sind Plane-Sweep und Patchbasierte Verfahren weisen unterschiedliche Vor- und Nachteile auf. In den letzten Jahren haben Methoden der MVSNet-Familie, die ein Kostenvolumen lernen, Genauigkeit und Robustheit weiter verbessert. Der gesamte Prozess umfasst das Fusionieren und Vernetzen der resultierenden Tiefenkarten. Das Verständnis des Unterschieds – MVS opfert Echtzeitleistung für Genauigkeit, während Stereo-/Tiefenkameras Echtzeitleistung priorisieren – ist die Grundlage für die richtige praktische Entscheidung.
Garantiert eine dichtere Punktwolke eine genauere Geometrie?
Mehr fehlerhafte Tiefenwerte verbessern die Genauigkeit nicht. Überprüfen Sie die Konsistenz der Mehransichten, Verdeckung, Reflexion und Textur getrennt von der Dichte.
Referenzen
- Collins, A Space-Sweep Approach to True Multi-Image Matching (CVPR 1996)
- Furukawa & Ponce, Accurate, Dichte und robuste Mehransichts-Stereopsis (IEEE TPAMI, 2010)
- Seitz, Curless, Diebel, Scharstein & Szeliski, Ein Vergleich und eine Bewertung von Mehransichts-Stereo-Rekonstruktionsalgorithmen (CVPR 2006)
- Schönberger, Zheng, Pollefeys & Frahm, Pixelweise Ansichtsauswahl für unstrukturierte Mehransichts-Stereo (ECCV 2016)
- Yao, Luo, Li, Fang & Quan, MVSNet: Tiefeninferenz für unstrukturierte Mehransichts-Stereo (ECCV 2018)
- Curless & Levoy, Eine volumetrische Methode zum Erstellen komplexer Modelle aus Tiefenbildern (SIGGRAPH 1996)
- Kazhdan, Bolitho & Hoppe, Poisson Surface Reconstruction (Eurographics Symposium on Geometry Processing, 2006)
- Offizielle COLMAP-Dokumentation: Dichte Rekonstruktion
Kommentare
Bitte zuerst anmelden.
Noch keine Einträge.