Contents — find the section you need

Eine Tiefenkamera erfasst die Entfernung (Tiefe) eines Objekts pixelgenau. Während Stereokameras passiv arbeiten und Disparitäten allein mit sichtbarem Licht erkennen, projizieren die meisten Tiefenkameras aktiv Licht auf das Objekt und leiten die Tiefe aus dem reflektierten Licht ab. Die Implementierungen lassen sich grob in drei Kategorien einteilen: „Aktives Stereo“, das mit einem Infrarotstrahler ein zufälliges Punktmuster projiziert und dieses stereoskopisch abgleicht; „Strukturiertes Licht“, das die Tiefe geometrisch anhand der Verzerrung eines bekannten Musters berechnet; und „Time-of-Flight“ (ToF), das die Entfernung direkt aus der Laufzeit (oder Phasenverschiebung) des Lichts ermittelt. Alle drei haben eine grundlegende Stärke gemeinsam: Da sie künstliche Signale nutzen, können sie die Tiefe selbst bei Objekten wie einer weißen Wand oder einem einfarbigen Boden erfassen, wo passives Stereo Schwierigkeiten hat, Disparitäten zu erkennen. Sie werden für SLAM-Systeme (Simulation, Light Motion) von Robotern in Innenräumen, Hand-Tracking in VR/AR, Gesichtserkennung von Smartphones und industrielle 3D-Messtechnik eingesetzt.

Eine Xbox 360 und ein Kinect-Sensor auf der E3 2010Kinect (2010, ausgestellt auf der E3)
Eine komplette Intel RealSense D435 mit kleinem StativIntel RealSense D435

Bilder: Kinect und Xbox 360 auf der E3 2010 (James Pfaff, CC BY 2.0) / Intel RealSense Tiefenkamera D435 (Marc Auledas, CC BY 2.0) BY-SA 4.0), beide Wikimedia Commons. Das RealSense-Foto zeigt die Basisversion D435, nicht die im Text beschriebene IMU-ausgestattete D435i.

Prinzip: Drei aktive Verfahren

Aktives Stereo projiziert ein Infrarotprojektor ein zufälliges Punktmuster auf ein Objekt. Anschließend wird die Tiefeninformation durch Stereoabgleich zwischen zwei Infrarotkameras anhand der Verschiebung dieses Musters berechnet. Das zugrundeliegende Prinzip ist die gleiche Triangulation wie beim passiven Stereo (siehe Artikel über Stereokameras), nur dass die Textur künstlich hinzugefügt wird. Die RealSense D400-Serie von Intel verwendet dieses Verfahren.

Strukturiertes Licht trianguliert mithilfe eines Paares aus einem Projektor, der ein bekanntes Muster aussendet, und einer einzelnen Kamera anstelle von zwei Kameras. Zwischen Projektor und Kamera befindet sich ebenfalls eine Basislinie. Die Tiefe wird zurückgerechnet, indem die Verzerrung des projizierten Musters (Punkte, Streifen usw.) an der Objektoberfläche mit einem bekannten Referenzmuster verglichen wird. Die ursprüngliche Kinect (2010) und Apples TrueDepth (iPhone Face ID) nutzen beide dieses Verfahren: TrueDepth projiziert über 30.000 Infrarotpunkte auf ein Gesicht, um dessen 3D-Form zu erfassen.

ToF (Time of Flight) wendet das gleiche Prinzip der Lichtlaufzeit wie LiDAR an, jedoch parallel pro Pixel. Neben der direkten Messung der Laufzeit eines Lichtimpulses (dToF) dominiert bei Tiefenkameras für Verbraucher und Industrie das iToF-Verfahren: Es projiziert moduliertes kontinuierliches Licht und leitet die Entfernung aus der Phasenverschiebung zwischen dem ausgesendeten und dem reflektierten Signal ab. Mit der Modulationsfrequenz f_{mod} und der Lichtgeschwindigkeit c ergibt sich die Entfernung Z zu:

Z = \frac{c \cdot \Delta\phi}{4\pi f_{mod}}

Da keine Triangulation erforderlich ist, benötigt das Verfahren keine Basislinie zwischen Projektor und Kamera. Dies vereinfacht die Miniaturisierung und eliminiert bewegliche Teile. Microsofts Produkte ab Kinect v2 und Orbbecs Femto Bolt nutzen dieses Verfahren. Alle drei Verfahren basieren auf Infrarotlicht und weisen daher eine gemeinsame Schwäche auf: Die Genauigkeit nimmt im Freien bei starkem Sonnenlicht, das reich an Infrarotstrahlung ist, tendenziell ab.

Diagram 1 · Use the button to switch views
Vergleich von aktiven Stereo-, Strukturlicht- und Time-of-Flight-Sensoranordnungen und ihren Entfernungsmessmerkmalen: Disparität, Musterverzerrung und Phasenverschiebung

Diagramm: Duskcoil. Blaue Linien zeigen projiziertes Licht; Gestrichelte orange Linien zeigen das vom Ziel reflektierte Licht. Aktives Stereo und strukturiertes Licht triangulieren über eine Basislinie, während ToF eine Zeit- oder Phasenverschiebung nutzt.

Vergleich der wichtigsten Produktspezifikationen

Produkt Methode Tiefenbereich Integrierte IMU Anwendung
Intel RealSense D435i Aktives Stereo (Infrarot-Musterprojektion) Ca. 0,3–3 m (unter bestimmten Bedingungen bis zu ca. 10 m) Bosch BMI055 (6-Achsen: Beschleunigungsmesser + Gyroskop) SLAM, VR/AR, Drohnenbewegungskompensation
Microsoft Kinect (Original, 2010) Strukturiertes Licht (von PrimeSense) Ca. 1,2–3,5 m Keine Bewegungserkennung für die Xbox 360-Spielkonsole. 320 x 240 Pixel Tiefe bei 30 Bildern pro Sekunde
Microsoft Kinect v2 / Azure Kinect ToF (Offizielle Spezifikationen variieren je nach Anwendung) Azure Kinect verfügt über eine integrierte IMU Azure Kinect wurde 2020 für Mixed Reality, Robotik und industrielle Anwendungen eingeführt; die Produktion wurde 2023 eingestellt
Orbbec Femto Bolt ToF (nutzt von Microsoft lizenzierte Technologie) Tiefenauflösung bis zu 1024 x 1024 Pixel, horizontales Sichtfeld 120° 6-Achsen-IMU Angekündigt 2023 als Nachfolger von Azure Kinect. 15 Bilder/s Tiefenmessung bei 1024 x 1024 Pixeln / 30 Bilder/s bei 640 x 576 Pixeln, mit integrierter 4K-RGB-Kamera
Apple iPhone TrueDepth Strukturiertes Licht (projiziert über 30.000 IR-Punkte) Sehr kurze Reichweite, optimiert für die Gesichtserkennung (funktioniert mit der IMU des iPhones zusammen) Face ID, Animoji, Motiverkennung im Porträtmodus

Die D435i ist die Basisversion der D435 mit einem zusätzlichen 6-Achsen-IMU (Bosch BMI055). Die IMU-Daten werden zeitsynchronisiert (zeitstempelgetreu) mit den Tiefendaten ausgegeben. Dadurch kann die Kamera ihre Eigenbewegungen bei der Verarbeitung von Tiefen- und Punktwolken korrigieren. Die ursprüngliche Kinect basierte auf der von dem israelischen Startup PrimeSense entwickelten Strukturlichttechnologie; ihr Nachfolger, die Kinect v2, nutzte ToF (Time-of-Flight). Die Produktion der Azure Kinect wurde 2023 eingestellt, Microsoft lizenzierte die ToF-Technologie jedoch an Orbbec. Der Nachfolger Femto Bolt verwendet dasselbe Tiefenkameramodul wie die Azure Kinect, was die Migration für bestehende Anwendungen vereinfacht. Die TrueDepth-Technologie des iPhones ist ein eigenständiger kommerzieller Zweig derselben PrimeSense-Strukturlichttechnologie – ein gutes Beispiel dafür, wie sich eine Technologie in zwei völlig unterschiedliche Anwendungen aufspalten kann: „Bewegungserkennung für Spielkonsolen“ und „Gesichtsauthentifizierung für Smartphones“.

Wie One Technology, PrimeSense, in die Bereiche Xbox, iPhone und Industrieroboter expandierte

Das israelische Unternehmen PrimeSense, das Kinect entwickelte – Die Kerntechnologie des ursprünglichen Kinect (erschienen 2010) wurde nicht von Microsoft selbst entwickelt, sondern basierte auf strukturierter Licht-Tiefenmessung des israelischen Startups PrimeSense. Kinect entwickelte sich schnell über seine Ursprünge als Spielekonsole hinaus und fand breite Anwendung in der akademischen und kommerziellen Robotik: Die Kombination aus einer Auflösung unter 720p mit gleichzeitiger Tiefen- und RGB-Erfassung zu einem Bruchteil der Kosten teurer LiDAR-Systeme war damals ein bemerkenswerter Erfolg für die Robotikforschung. Eine 2011 von Richard Newcombe, Shahram Izadi und Kollegen bei Microsoft Research veröffentlichte Arbeit mit dem Titel „KinectFusion: Echtzeit-Oberflächenkartierung und -verfolgung“ (IEEE ISMAR 2011) demonstrierte die Echtzeit-Kartierung dichter 3D-Oberflächen mithilfe lediglich einer einzigen kostengünstigen Tiefenkamera und einer Standard-GPU. Sie gilt als eine der Grundlagenarbeiten der RGB-D-SLAM-Forschung.

Apples Übernahme von PrimeSense und dessen Wiedergeburt als Face ID – Im November 2013 erwarb Apple PrimeSense für 360 Millionen US-Dollar. Das hat die Strukturlichttechnologie des ursprünglichen Kinect nicht vom Markt verschwinden lassen – ihre technische Grundlage bildete den Kern von Face ID und fand sich im „TrueDepth“-Kamerasystem des iPhone X wieder (bestehend aus einem Infrarot-Flutlichtstrahler, einem Punktprojektor und einer Infrarotkamera), das 2017 vorgestellt wurde. Es handelt sich um ein außergewöhnlich umfangreiches Beispiel für die Wiederverwendung von Technologie: Eine für die Bewegungserkennung von Spielkonsolen entwickelte Technologie wurde sieben Jahre später zur zentralen biometrischen Authentifizierungstechnologie, die in einer Milliarde Smartphones verbaut wird.

Microsoft stellt Kinect „erneut“ ein – Über mehr als ein Jahrzehnt hat Microsoft immer wieder Generationen von Kinect-Produkten auf den Markt gebracht und wieder eingestellt: Kinect für Xbox 360, Kinect für Xbox One, Kinect für Windows v2 und das industriell/forschungsorientiert ausgerichtete Azure Kinect DK. Die im August 2023 angekündigte Einstellung des Azure Kinect DK markierte das jüngste (und bisher letzte) Ende der Kinect-Reihe. Doch diesmal war es kein vollständiger Rückzug – Microsoft entschied sich stattdessen, seine ToF-Technologie an Orbbec zu lizenzieren, und Orbbecs „Femto Bolt“ nutzte dasselbe Tiefenkameramodul wie Azure Kinect. Dieses Muster erinnert an die Übernahme von PrimeSense ein Jahrzehnt zuvor: Eine Technologie übersteht den Übergang zu einem anderen Unternehmen.

Leistungsparameter

  • Tiefenreichweite: Die Reichweite der D435i beträgt ca. 0,3–3 m (unter bestimmten Bedingungen bis zu ca. 10 m). Sie eignet sich für den Nah- bis Mittelbereich und ist ideal zur Hinderniserkennung auf Tischen oder in der Nähe von Regalen für einen Indoor-Roboter oder für Anwendungen im Nahbereich wie Handverfolgung. Für die Überwachung im Freien über größere Entfernungen sind Stereokameras oder LiDAR besser geeignet.

  • Wahl des Verfahrens (aktives Stereo / Strukturiertes Licht / ToF): Aktives Stereo erfordert zwar die Berechnung des Stereo-Matchings, lässt sich aber aus relativ kostengünstigen Komponenten realisieren. Strukturiertes Licht bietet hohe Genauigkeit im Nahbereich und eignet sich daher für Anwendungen mit sehr hoher Präzision wie Face ID. Allerdings stößt es bei der Miniaturisierung an seine Grenzen, da eine Basislinie zwischen Projektor und Kamera benötigt wird. ToF kommt ohne bewegliche Teile und Basislinie aus und lässt sich daher leichter miniaturisieren, erreicht aber in der Regel nicht die Nahbereichsgenauigkeit von strukturiertem Licht. Der Femto Bolt, der eine Tiefenauflösung von 1024 x 1024 Pixeln in einem kompakten Gehäuse vereint, nutzt genau diesen Miniaturisierungsvorteil von ToF.

  • Integrierte IMU und Zeitsynchronisation: Bei Anwendungen, bei denen sich die Kamera selbst bewegt (Handkamera, Drohnenkamera, mobiler Roboter), bestimmt die Präzision der Zeitsynchronisation von Tiefen- und IMU-Daten die Genauigkeit der Bewegungsunschärfekorrektur. Die integrierten IMUs des D435i, Azure Kinect und Femto Bolt sind speziell für diesen Anwendungsfall konzipiert.

  • Toleranz gegenüber Umgebungslicht: Alle drei Infrarot-basierten Verfahren arbeiten in Innenräumen stabil, die Genauigkeit nimmt jedoch im Freien bei starker Sonneneinstrahlung ab, da das projizierte Muster oder das reflektierte Signal überstrahlt wird. Anwendungen, die im Freien eingesetzt werden sollen, müssen daher in der Regel auf passive Stereo-Technologie (ZED usw.) oder eine Kombination verschiedener Verfahren zurückgreifen.

  • Objekttextur: Für die Robotik in Innenräumen und VR/AR-Anwendungen, die mit texturarmen Objekten wie weißen Wänden oder einfarbigen Böden arbeiten, bietet ein aktives Verfahren, das ein Infrarotmuster künstlich projizieren kann, Vorteile. Dieser Vorteil verringert sich in texturreichen Umgebungen im Freien.

  • Minimale Messdistanz: Bei Anwendungen, die Tiefeninformationen im Nahbereich benötigen – wie Handverfolgung oder Gesichtserkennung – bestimmt die untere Grenze der Messdistanz direkt die Nutzbarkeit. TrueDepth, speziell entwickelt für ein Ziel im Abstand von nur wenigen Zentimetern (ein Gesicht), ist das Paradebeispiel dafür.

Schätzung des Entfernungsfehlers nach Methode

Bei aktiver Stereoskopie gilt die Grundrelation Z=fB/d, wodurch die Disparitätsunsicherheit \sigma_d verstärkt wird:

\sigma_Z\simeq\frac{Z^2}{fB}\sigma_d

Mit f=600\,\mathrm{px}, B=0.05\,\mathrm{m}, Z=3\,\mathrm{m} und \sigma_d=0.25\,\mathrm{px} beträgt der Entfernungsfehler etwa 7.5\,\mathrm{cm}. Ein projiziertes Muster erleichtert das Matching an einer texturarmen Wand, jedoch können Punkte bei starkem Sonnenlicht oder auf infrarotabsorbierenden Materialien verschwinden.

Bei ToF dominieren Phasen- oder Zeitmessung, Reflektivität, Mehrwegeausbreitung und Integrationszeit. Daher entspricht eine Tiefenauflösung von 1024 × 1024 Pixeln nicht der Standardabweichung der Entfernungsmessung. Bei der Geräteauswahl sollten Zielentfernung und Material konstant gehalten und die Ausfallrate, die Ausreißerrate, die Frame-Latenz sowie der Zeitstempelversatz zwischen Tiefe, RGB und IMU gemessen werden.

Diagram 2 · Use the button to switch views
Berechneter aktiver Stereo-Entfernungsmessfehler in Abhängigkeit von der Entfernung neben separaten ToF-Fehlerpfaden für Phasenauslesung, Mehrwegeausbreitung und geringe Reflexion

Abbildung 2 – Die Werte links wurden aus f,B,\sigma_d des Artikels berechnet. Rechts wird erläutert, warum ToF-Zufallsfehler, Bias und ungültige Rückstreuungen separate Messungen erfordern. Dies ist keine Geräte-Leistungskurve.

Überprüfen Sie Ihr Verständnis
Entspricht fehlende Tiefe null Metern?

Es bedeutet, dass keine Entfernungsmessung durchgeführt wurde.

Definieren Sie die Behandlung ungültiger Werte, anstatt fehlende Daten als nahegelegenes Objekt oder freien Speicherplatz zu behandeln.

Referenzen

What to read next

Review the backgroundFunktionsweise von Stereokameras und wichtige Produkte – ZED 2i, Subaru EyeSightContinue the seriesFunktionsweise von IMUs und wichtige Produkte – Xsens, Bosch, Analog DevicesExplore another aspect of this fieldLesen Sie ein stationäres IMU-Log: Bias, Streuung und Allan-Abweichung